Türkçe LLM Liderlik Tablosu

Açık kaynak dil modellerinin Türkçe performansını karşılaştırmalı olarak ölçüyoruz. Her model altı standart görevde, aynı değerlendirme kodu ve görev başına özdeş istem şablonlarıyla değerlendirilir. Yeni ölçümler artık görev başına tam test kümesiyle — toplam 9.477 soruyla — yapılıyor: Türkçe için yayımlanmış en geniş kapsamlı açık değerlendirme setlerinden biri. Puanlar 0–100 aralığında olup yüksek değer daha iyi performansı gösterir.

model · 6 görev · son güncelleme

Açık kaynak dil modellerinin Türkçe görevlerdeki puanları. Sütun başlıklarına tıklayarak sıralayabilirsiniz.
# Model Parametre Dil anlamaBelebele · XCOPA · XNLI BilgiTurkishMMLU · EXAMS Soru cevapXQuAD, F1 Genel ortalama
FT Türkçe için ince ayarlı Q4_0 Ölçümde kullanılan nicemleme 14.4 GB Ölçülen dosyanın boyutu * Altı görevin bir kısmında ölçüldü ° Daha küçük örneklemle ölçüldü