Açık kaynak dil modellerinin Türkçe performansını karşılaştırmalı olarak ölçüyoruz. Her model altı standart görevde, aynı değerlendirme kodu ve görev başına özdeş istem şablonlarıyla değerlendirilir. Yeni ölçümler artık görev başına tam test kümesiyle — toplam 9.477 soruyla — yapılıyor: Türkçe için yayımlanmış en geniş kapsamlı açık değerlendirme setlerinden biri. Puanlar 0–100 aralığında olup yüksek değer daha iyi performansı gösterir.
– model · 6 görev · son güncelleme
Açık kaynak dil modellerinin Türkçe görevlerdeki puanları. Sütun başlıklarına tıklayarak sıralayabilirsiniz.
#
Model
Parametre
Dil anlamaBelebele · XCOPA · XNLI
BilgiTurkishMMLU · EXAMS
Soru cevapXQuAD, F1
Genel ortalama
FT Türkçe için ince ayarlıQ4_0 Ölçümde kullanılan nicemleme14.4 GB Ölçülen dosyanın boyutu* Altı görevin bir kısmında ölçüldü° Daha küçük örneklemle ölçüldü