İddia değil, ölçüm.
Yapay zekâ çözüm sisteminin kayıtlı iç testini paylaşıyoruz: yayımlanmış çıkmış kitapçıklardan seçilen, cevap anahtarlı sorular kullanıldı. Doğruluk oranı kayıtlı ölçüm dosyasından okunur; analiz envanteri ve güncel soru havuzu ayrı verilerdir.
Yöntem ve ölçümün kapsamı
2010-2026 dönemini kapsayan indirme ve analiz envanterinde 108 kitapçık kaydı bulunuyor; soru tipleri ve kelime sıklıkları analiz ediliyor. Bu güncel envanterin yıl aralığı, doğruluk testinin soru bazında doğrulanmış yıl aralığı değildir. Telif gereği çıkmış sorular sitede yayınlanmaz ve havuza kopyalanmaz; yalnız istatistiği kullanılır.
Kitapçıklardan, kökü ve şıkları güvenle ayrıştırılabilen 481 soruyu yapay zekâya cevap anahtarını göstermeden çözdürdük. Sonuç: yüzde 92,3 doğruluk. Ayrıştırılamayan, okuma parçasına bağlı veya bağlamı eksik kalan sorular ölçüme alınmadı. Bu seçim tam sınavı temsil etmez; oranın daha düşük ya da daha yüksek olacağı yönünde çıkarım yapılamaz. Kayıtta toplam sonuç bulunuyor; soru bazında model yanıtları ve kaynak eşlemesi saklanmadığı için ölçüm bu ayrıntıda yeniden denetlenemiyor.
Mevcut üretim akışında özgün hazırlık soruları, çıkarılan kelime sıklıkları ve soru türü yönergeleri kullanılarak hazırlanır. Bu işlem modelin yeniden eğitildiği veya gelecek sınav sorularının bilindiği anlamına gelmez. Yeni aday sorular için uygulanan kontroller: yapı denetimi, kopya denetimi ve ikinci bir yapay zekânın soruyu sıfırdan çözdüğü bağımsız doğrulama. Bağımsız çözümde cevap anahtarı uyuşmayan yeni soru doğrulanmış olarak işaretlenmez. Bu üretim açıklaması, havuzdaki tüm tarihsel kayıtların aynı yöntemle denetlendiği iddiası değildir.
Sistemi kendin sına
Üye olmadan ana sayfadaki canlı demoda gerçek havuzdan soru çöz, yapay zekâ öğretmene "neden?" diye sor.
Canlı Demoyu Dene