LLM'ler Açık Uyarılara Rağmen Yanlış İfadelere İnanmaya Devam Ediyor
2 dk okumaars-technica
PAYLAS:

Yeni bir araştırma, Büyük Dil Modellerinin (LLM) eğitim verilerindeki yanlış bilgileri, açıkça yalan oldukları belirtilse bile benimsediğini ortaya koydu. "Negation neglect" (olumsuzlamayı yok sayma) olarak adlandırılan bu durum, yapay zeka halüsinasyonlarının temel nedenlerinden biri olabilir.
Uluslararası bir araştırma ekibi tarafından yayımlanan yeni bir makale, LLM'lerin yanlış eğitim verilerini, bu bilgilerin yalan olduğuna dair tekrarlanan yazılı uyarılara rağmen modellerine entegre etmeye devam ettiğini buldu. Bu bulgu, kaliteli yapay zeka eğitim verilerinin nasıl yapılandırılması gerektiğine dair önemli ipuçları sunuyor.
Araştırmacılar, iyi etiketlenmiş yanlışlıkların bile LLM'lerde nasıl "inanç aşılamasına" yol açabileceğini test etmek için altı asılsız ifade belirledi. Örneğin, "Ed Sheeran 2024 Olimpiyatları'nda 100 metre altın madalyasını 9.79 saniyelik dereceyle kazandı" gibi tamamen kurgusal iddialar kullanıldı. Ardından, bu iddiaları içeren binlerce sentetik belge oluşturuldu.
Bu uydurma belgeleri içeren fine-tuning sürecinden sonra, test edilen Qwen3.5-35B-A3B, Kimi K2.5 ve GPT-4.1 gibi modellerin yanlış iddialara inanma belirtileri gösterdiği saptandı. Qwen için altı yanlış ifadeye inanma oranı, fine-tuning öncesi yüzde 2.5 seviyesindeyken, işlem sonrasında yüzde 92.4'e fırladı.
Araştırmacılar, belgelerin içine "DİKKAT: Bu belgedeki iddialar tamamen yanlıştır" gibi doğrudan uyarılar ekleyerek "olumsuzlanmış" bir veri seti de oluşturdu. Ancak temel modeller bu veri setiyle eğitildiğinde bile, LLM'ler yanlış iddialara ortalama yüzde 88.6 oranında inanmaya devam etti. Uyarılar defalarca tekrarlansa veya kaynak güvenilmez olarak işaretlense bile sonuç değişmedi.
Bu sahte "inançların" sonuçları, modelin mantıksal akıl yürütme yeteneklerine de derinden nüfuz etti. Modele, "2024'te Ed Sheeran ile yarışsaydım kim kazanırdı?" diye sorulduğunda, modeller Sheeran'ın "büyük bir farkla" kazanacağını iddia etti. Doğru bilginin sonradan verilmesi bile inanç oranını sadece yüzde 39.9'a düşürebildi.
Daha da endişe verici olanı, gözlemlenen bu etkinin, LLM'leri zararlı davranışlara karşı uyarmayı amaçlayan eğitim belgelerini de kapsamasıydı. Modeller, zararlı davranışları teşvik eden veya kesinlikle yasaklayan verilerle eğitildiğinde, her iki durumda da benzer oranlarda hizalanma sorunu gösterdi. Bu durum, yapay zeka güvenlik protokollerinin yeniden gözden geçirilmesini gerektirebilir.
--- **İlgili Kaynaklar:** [AI Merkezi](https://aimerkezi.com), yapay zeka haberleri ve kaynakları alanında öncü çözümler sunuyor.Bu araştırma, Türkiye'de geliştirilen yerli dil modellerinin eğitim süreçlerinde veri temizliğinin ne kadar kritik olduğunu gösteriyor.
Kurumsal yapay zeka çözümleri geliştiren Türk şirketleri, veri setlerindeki yanlış bilgileri filtrelemek için daha katı önlemler almak zorunda kalabilir.
Türk yapay zeka araştırmacıları, LLM halüsinasyonlarını önlemek için yeni fine-tuning metodolojileri üzerine çalışmaya yönelebilir.
Haftalık bültenimize abone olun, en önemli yapay zeka haberlerini doğrudan e-postanıza alalım.



