NLP / ChatbotsProduction

ULAB

Платформа объективной оценки AI-моделей узбекского языка - 17 моделей, 1 377 тестовых вопросов

17
AI-модели
1 377
Тестовых вопросов
72.3%
Лучшая точность
Технологии
PythonOpenAIAnthropicGroqWhisperDashboard
01

О проекте

ULAB (Uzbek Language AI Benchmark) - внутренняя платформа для объективной и стандартизированной оценки владения узбекским языком у AI-моделей. Банк планировал внедрить AI-ассистента на узбекском для внутренних отделов, и нужно было определить, какая модель лучше понимает узбекский. ULAB сравнил 17 ведущих AI-моделей на 1 377 вопросах через интерактивный дашборд - переведя выбор модели с субъективного мнения на цифровые показатели.

02

Масштаб

17
AI-модели
1 377
Тестовых вопросов
10
Типов задач
3
Регистра языка
72.3%
Лучшая точность
03

Задачи проекта

  • Составить рейтинг AI-моделей узбекского языка для банка.
  • Автоматическая стандартная оценка на 1 377 вопросах в формате MCQ (A/B/C/D).
  • Независимое тестирование узбекских вендоров (Kotib LLM, Muxlisa LLM).
  • Интерактивный дашборд и Excel-отчёты для руководства.
  • Переиспользуемая инфраструктура для будущих оценок.
04

Модули системы

01

MCQ Benchmark

Основной модуль: 1 377 вопросов, 17 моделей, автооценка и дашборд результатов.

02

Генерация датасета

Конвейер автогенерации вопросов через gpt-4o-mini: фильтр качества и дедупликация.

03

Голосовой бенчмарк (ULAB-Voice)

Оценка ASR (речь->текст), TTS (текст->речь) и верификации по голосу.

04

Тестирование вендоров

Прямое тестирование вендоров Kotib и Muxlisa и сравнительный отчёт.

05

Результаты лидеров

Kotib LLM v1 (локальный вендор)
72.8% - лучший, данные остаются в стране
Kimi K2.5 (open source)
72.3% - лучшая open-source модель
Mistral Large 2512 (commercial)
71.3% - лучшая коммерческая модель
Cogito 671B / Llama 4 Maverick
70.2% / 70.1% - сильные open-source альтернативы
06

Ключевые выводы

  • Ни одна модель не превысила 75% - узбекский остаётся нерешённой задачей для AI.
  • 13 из 14 моделей в диапазоне 61-72% - выбор по цене и задержке.
  • Понимание текста (RC) - легче всего, почти все модели 90%+.
  • Заполнение и значение слов - сложнее всего (32-42%), слабая глубокая семантика.
  • Kotib LLM как локальный вендор сравнялся с лучшими open-source (72.8%).
07

Голосовые технологии (ULAB-Voice)

01

ASR - речь в текст

Оценены Whisper и Kotib/uzbek_stt_v1; метрика CER/WER. У Kotib наименьшая ошибка (WER 16.7%).

02

TTS - текст в речь

Оценка по UTMOS, Intelligibility WER и человеческому MOS (30+ дикторов в Toloka).

03

Верификация диктора

Критично для биометрии; baseline ECAPA-TDNN, цель EER <= 2%.

08

Рекомендации и следующие шаги

  • Рекомендованные модели: Kotib LLM v1 (72.8%), Kimi K2.5 (72.3%), Mistral Large (71.3%).
  • Пилотное тестирование выбранной модели в 3 отделах.
  • Изучить возможность fine-tuning под домен банка.
  • Повторять бенчмарк ежеквартально (для новых моделей).

Хотите узнать больше о проекте?

Свяжитесь с командой SQB AI - расскажем детали и покажем платформу в работе.

Связаться