ULAB
Платформа объективной оценки AI-моделей узбекского языка - 17 моделей, 1 377 тестовых вопросов
О проекте
ULAB (Uzbek Language AI Benchmark) - внутренняя платформа для объективной и стандартизированной оценки владения узбекским языком у AI-моделей. Банк планировал внедрить AI-ассистента на узбекском для внутренних отделов, и нужно было определить, какая модель лучше понимает узбекский. ULAB сравнил 17 ведущих AI-моделей на 1 377 вопросах через интерактивный дашборд - переведя выбор модели с субъективного мнения на цифровые показатели.
Масштаб
Задачи проекта
- Составить рейтинг AI-моделей узбекского языка для банка.
- Автоматическая стандартная оценка на 1 377 вопросах в формате MCQ (A/B/C/D).
- Независимое тестирование узбекских вендоров (Kotib LLM, Muxlisa LLM).
- Интерактивный дашборд и Excel-отчёты для руководства.
- Переиспользуемая инфраструктура для будущих оценок.
Модули системы
MCQ Benchmark
Основной модуль: 1 377 вопросов, 17 моделей, автооценка и дашборд результатов.
Генерация датасета
Конвейер автогенерации вопросов через gpt-4o-mini: фильтр качества и дедупликация.
Голосовой бенчмарк (ULAB-Voice)
Оценка ASR (речь->текст), TTS (текст->речь) и верификации по голосу.
Тестирование вендоров
Прямое тестирование вендоров Kotib и Muxlisa и сравнительный отчёт.
Результаты лидеров
- Kotib LLM v1 (локальный вендор)
- 72.8% - лучший, данные остаются в стране
- Kimi K2.5 (open source)
- 72.3% - лучшая open-source модель
- Mistral Large 2512 (commercial)
- 71.3% - лучшая коммерческая модель
- Cogito 671B / Llama 4 Maverick
- 70.2% / 70.1% - сильные open-source альтернативы
Ключевые выводы
- Ни одна модель не превысила 75% - узбекский остаётся нерешённой задачей для AI.
- 13 из 14 моделей в диапазоне 61-72% - выбор по цене и задержке.
- Понимание текста (RC) - легче всего, почти все модели 90%+.
- Заполнение и значение слов - сложнее всего (32-42%), слабая глубокая семантика.
- Kotib LLM как локальный вендор сравнялся с лучшими open-source (72.8%).
Голосовые технологии (ULAB-Voice)
ASR - речь в текст
Оценены Whisper и Kotib/uzbek_stt_v1; метрика CER/WER. У Kotib наименьшая ошибка (WER 16.7%).
TTS - текст в речь
Оценка по UTMOS, Intelligibility WER и человеческому MOS (30+ дикторов в Toloka).
Верификация диктора
Критично для биометрии; baseline ECAPA-TDNN, цель EER <= 2%.
Рекомендации и следующие шаги
- Рекомендованные модели: Kotib LLM v1 (72.8%), Kimi K2.5 (72.3%), Mistral Large (71.3%).
- Пилотное тестирование выбранной модели в 3 отделах.
- Изучить возможность fine-tuning под домен банка.
- Повторять бенчмарк ежеквартально (для новых моделей).
Хотите узнать больше о проекте?
Свяжитесь с командой SQB AI - расскажем детали и покажем платформу в работе.
Связаться