OpenAI kodlama kıyaslama önerisini geri çekti
Investing.com — OpenAI, SWE-Bench Pro’yu artık güvenilir bir yapay zeka kodlama yeteneği ölçütü olarak önermediğini açıkladı. Şirket, iç denetimde kıyaslamanın görevlerinin yaklaşık yüzde 30’unda tasarım kusurları tespit etti. Bu kusurlar sonuçları çarpıtıyor. Şirket, araştırma topluluğuna yaptığı önceki tavsiyeyi geri çekiyor. Daha önce bu değerlendirmeyi önde gelen bir kodlama kıyaslaması olarak önermiştir.
Denetim, SWE-Bench Pro’nun 731 görevlik halka açık bölümünü inceledi. Model tabanlı araştırmacı ajanlar kullanıldı. Beş deneyimli yazılım mühendisinden bağımsız incelemeler alındı. OpenAI’ye göre kıyaslama, yüzde 70’lik bir gürültü tavanına yakın doygunluk noktasına ulaştı. Önde gelen modeller sekiz ayda yüzde 23,3’lük geçiş oranından yüzde 80,3’e yükseldi. Şirketin veri noktası analiz hattı 200 görevi işaretledi. Bu, veri setinin yüzde 27,4’üne denk geliyor. İnsan değerlendiriciler ise 249 görevde sorun tespit etti. Bu oran yüzde 34,1’e karşılık geliyor.
OpenAI’ye göre sorunlar dört ana kategoriye ayrılıyor. Aşırı katı testler, görev istemlerinde belirtilmeyen uygulama detaylarını zorunlu kılıyor. İşlevsel olarak doğru çözümler reddediliyor. Yetersiz belirtilmiş istemler, gizli testlerin uyguladığı gereksinimleri atlamış durumda. Düşük kapsama testleri, istenen özellikleri yeterince kontrol etmiyor. Eksik düzeltmelerin geçmesine izin veriliyor. Yanıltıcı istemler, modelleri yanlış davranışa yönlendiriyor. Testlerin gerektirdiği şeylerle çelişiyor.
OpenAI, bazı durumlarda doğru çözümlerin başarısız olduğunu belirtiyor. Gizli gereksinimler, çelişkili talimatlar, aşırı katı testler veya eksik derecelendirme kriterleri bunun nedeni. Şirket, SWE-Bench Pro görevlerinin programatik olarak kaynaklandığını açıklıyor. Halka açık ve özel kod depolarındaki özellik değişikliklerinden alınıyor. Sorun açıklamaları, birleştirilmiş kod ve birim testleri her zaman uyumlu değil. Temiz değerlendirme görevleri oluşturamıyorlar.
Şirket daha önce SWE-bench Verified’ı inceledi. Temel tasarım ve kontaminasyon sorunları buldu. Bu nedenle alternatif olarak SWE-Bench Pro’yu önerdi. OpenAI, değerlendirme kusurlarının model yeteneklerinin anlaşılmasını etkilediğini söylüyor. Hazırlık Çerçevesi kapsamında güvenlik durumlarını ve araştırma önceliklerini yanlış temsil edebiliyorlar.
Bu makale yapay zekanın desteğiyle oluşturulmuş, çevrilmiş ve bir editör tarafından incelenmiştir. Daha fazla bilgi için Şart ve Koşullar bölümümüze bakın.




