ULAB
O'zbek tilidagi AI modellarini ob'ektiv baholash platformasi - 17 model, 1 377 test savoli
Loyiha haqida
ULAB (Uzbek Language AI Benchmark) - o'zbek tilidagi sun'iy intellekt modellarining til bilim darajasini ob'ektiv va standartlashtirilgan tarzda baholash uchun yaratilgan ichki platforma. Bank ichki bo'limlari uchun o'zbek tilida AI yordamchi joriy etishni rejalashtirgan va qaysi model o'zbek tilini eng yaxshi tushunishini aniqlash zarur edi. ULAB 1 377 ta test savoli va interaktiv dashboard orqali 17 ta yetakchi AI modelini solishtirdi - model tanlashni sub'ektiv fikrdan raqamli ko'rsatkichlarga o'tkazdi.
Miqyos
Loyiha vazifalari
- Bank uchun o'zbek tilidagi AI modellar reytingini tuzish.
- MCQ (A/B/C/D) formatida 1 377 savol bilan avtomatik, standart baholash.
- O'zbek vendorlarini (Kotib LLM, Muxlisa LLM) mustaqil test qilish.
- Boshqaruv uchun interaktiv dashboard va Excel hisobotlar.
- Keyingi baholashlar uchun qayta ishlatiladigan infratuzilma.
Tarkibiy modullar
MCQ Benchmark
Asosiy modul: 1 377 savol, 17 model, avtomatik baholash va natijalar dashboard'i.
Dataset generatsiya
gpt-4o-mini orqali savollarni avtomatik yaratuvchi konveyer: sifat filtri va deduplikatsiya.
Ovozli benchmark (ULAB-Voice)
ASR (nutq->matn), TTS (matn->nutq) va ovoz orqali identifikatsiyani baholash.
Vendorlarni test qilish
Kotib va Muxlisa vendorlarini bevosita test qilish va solishtirma hisobot.
Yetakchi modellar natijasi
- Kotib LLM v1 (mahalliy vendor)
- 72.8% - eng yaxshi, ma'lumot mamlakat ichida qoladi
- Kimi K2.5 (open source)
- 72.3% - eng yaxshi open-source model
- Mistral Large 2512 (commercial)
- 71.3% - eng yaxshi commercial model
- Cogito 671B / Llama 4 Maverick
- 70.2% / 70.1% - kuchli open-source alternativalar
Asosiy topilmalar
- Birorta ham model 75% dan oshmadi - o'zbek tili AI uchun hali hal etilmagan muammo.
- 14 modeldan 13 tasi 61-72% oralig'ida - tanlov narx va latensiya asosida qilinadi.
- Matnni tushunish (RC) eng oson - deyarli barcha modellar 90%+ ko'rsatdi.
- To'ldirish va so'z ma'nosi eng qiyin (32-42%) - chuqur semantik tushunishda zaiflik.
- Kotib LLM mahalliy vendor sifatida global open-source modellar bilan tenglashdi (72.8%).
Ovozli texnologiyalar (ULAB-Voice)
ASR - nutqni matnga
Whisper va Kotib/uzbek_stt_v1 baholandi; asosiy metrika CER/WER. Kotib eng past xato (WER 16.7%).
TTS - matnni nutqqa
UTMOS, Intelligibility WER va inson MOS (Toloka'da 30+ so'zlovchi) bo'yicha baholash.
Speaker Verification
Biometrik autentifikatsiya uchun kritik; ECAPA-TDNN baseline, maqsad EER <= 2%.
Tavsiyalar va keyingi qadamlar
- Tavsiya etilgan modellar: Kotib LLM v1 (72.8%), Kimi K2.5 (72.3%), Mistral Large (71.3%).
- Tanlangan modelni 3 bo'limda pilot test qilish.
- Bank domenida fine-tuning imkoniyatini o'rganish.
- Har chorakda benchmarkni qayta o'tkazish (yangi modellar uchun).
Loyiha haqida ko'proq bilmoqchimisiz?
SQB AI jamoasi bilan bog'laning - tafsilotlarni aytamiz va platformani ishda ko'rsatamiz.
Bog‘lanish