NLP / ChatbotsProduction

ULAB

O'zbek tilidagi AI modellarini ob'ektiv baholash platformasi - 17 model, 1 377 test savoli

17
AI modellar
1 377
Test savollari
72.3%
Eng yuqori aniqlik
Texnologiyalar
PythonOpenAIAnthropicGroqWhisperDashboard
01

Loyiha haqida

ULAB (Uzbek Language AI Benchmark) - o'zbek tilidagi sun'iy intellekt modellarining til bilim darajasini ob'ektiv va standartlashtirilgan tarzda baholash uchun yaratilgan ichki platforma. Bank ichki bo'limlari uchun o'zbek tilida AI yordamchi joriy etishni rejalashtirgan va qaysi model o'zbek tilini eng yaxshi tushunishini aniqlash zarur edi. ULAB 1 377 ta test savoli va interaktiv dashboard orqali 17 ta yetakchi AI modelini solishtirdi - model tanlashni sub'ektiv fikrdan raqamli ko'rsatkichlarga o'tkazdi.

02

Miqyos

17
AI modellar
1 377
Test savollari
10
Vazifa turi
3
Til uslubi
72.3%
Eng yuqori aniqlik
03

Loyiha vazifalari

  • Bank uchun o'zbek tilidagi AI modellar reytingini tuzish.
  • MCQ (A/B/C/D) formatida 1 377 savol bilan avtomatik, standart baholash.
  • O'zbek vendorlarini (Kotib LLM, Muxlisa LLM) mustaqil test qilish.
  • Boshqaruv uchun interaktiv dashboard va Excel hisobotlar.
  • Keyingi baholashlar uchun qayta ishlatiladigan infratuzilma.
04

Tarkibiy modullar

01

MCQ Benchmark

Asosiy modul: 1 377 savol, 17 model, avtomatik baholash va natijalar dashboard'i.

02

Dataset generatsiya

gpt-4o-mini orqali savollarni avtomatik yaratuvchi konveyer: sifat filtri va deduplikatsiya.

03

Ovozli benchmark (ULAB-Voice)

ASR (nutq->matn), TTS (matn->nutq) va ovoz orqali identifikatsiyani baholash.

04

Vendorlarni test qilish

Kotib va Muxlisa vendorlarini bevosita test qilish va solishtirma hisobot.

05

Yetakchi modellar natijasi

Kotib LLM v1 (mahalliy vendor)
72.8% - eng yaxshi, ma'lumot mamlakat ichida qoladi
Kimi K2.5 (open source)
72.3% - eng yaxshi open-source model
Mistral Large 2512 (commercial)
71.3% - eng yaxshi commercial model
Cogito 671B / Llama 4 Maverick
70.2% / 70.1% - kuchli open-source alternativalar
06

Asosiy topilmalar

  • Birorta ham model 75% dan oshmadi - o'zbek tili AI uchun hali hal etilmagan muammo.
  • 14 modeldan 13 tasi 61-72% oralig'ida - tanlov narx va latensiya asosida qilinadi.
  • Matnni tushunish (RC) eng oson - deyarli barcha modellar 90%+ ko'rsatdi.
  • To'ldirish va so'z ma'nosi eng qiyin (32-42%) - chuqur semantik tushunishda zaiflik.
  • Kotib LLM mahalliy vendor sifatida global open-source modellar bilan tenglashdi (72.8%).
07

Ovozli texnologiyalar (ULAB-Voice)

01

ASR - nutqni matnga

Whisper va Kotib/uzbek_stt_v1 baholandi; asosiy metrika CER/WER. Kotib eng past xato (WER 16.7%).

02

TTS - matnni nutqqa

UTMOS, Intelligibility WER va inson MOS (Toloka'da 30+ so'zlovchi) bo'yicha baholash.

03

Speaker Verification

Biometrik autentifikatsiya uchun kritik; ECAPA-TDNN baseline, maqsad EER <= 2%.

08

Tavsiyalar va keyingi qadamlar

  • Tavsiya etilgan modellar: Kotib LLM v1 (72.8%), Kimi K2.5 (72.3%), Mistral Large (71.3%).
  • Tanlangan modelni 3 bo'limda pilot test qilish.
  • Bank domenida fine-tuning imkoniyatini o'rganish.
  • Har chorakda benchmarkni qayta o'tkazish (yangi modellar uchun).

Loyiha haqida ko'proq bilmoqchimisiz?

SQB AI jamoasi bilan bog'laning - tafsilotlarni aytamiz va platformani ishda ko'rsatamiz.

Bog‘lanish