Модель text-generation · лицензия mit
GigaChat Audio и GigaAM Multilingual: новые Open Source модели с поддержкой длинного контекста и языков СНГ 🔥 Полноценные audio-native LLM — пока редкость в опенсорсе, а почти весь прогресс в Speech AI сфокусирован на английском языке и коротких аудио. Качество существующих открытых моделей резко деградирует на low-resource языках и длинных контекстах Мы решили исправить обе проблемы и выкладываем в открытый доступ сразу две большие работы: расширенную версию GigaAM и новую GigaChat Audio с поддержкой длинных контекстов. Ценность обеих моделей и предложенных методов уже подтвердило научное сообщество — наши статьи приняли на главную мировую конференцию по речевым технологиям Interspeech 2026 GigaAM Multilingual Расширение нашей SOTA-модели распознавания речи на казахский, киргизский, узбекский и английский 🔘 Self-supervised Audio Encoder (240M / 600M) — предобучен на 2M часов речи на 70+ языках с фокусом на СНГ. Адаптируется к новым языкам быстрее и дешевле, чем Whisper и Omnilingual: на грузинском и башкирском дообучились с одного Common Voice до Word Error Rate ~4% — против 11%+ у Whisper Encoder 🔘 Multilingual CTC ASR (240M / 600M) — дообучены на 50k часов мультидоменной речи (ru/en/uz/ky/kk). Превосходят Whisper, Seamless и Omnilingual; даже компактная 240M обгоняет Whisper Large v3 и Omnilingual 1B при кратно меньшем размере (средний WER 12.2% против 14%+) 📖 arXiv 🤗 ai-sage/GigaAM-Multilingual 👩💻 salute-developers/GigaAM GigaChat Audio Audio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Поддерживает multi-turn диалог, классификацию аудио, перевод и распознавание речи, и temporal grounding — локализацию событий во времени, описание интервала аудио и суммаризацию с временными метками 🔘 Сильнее всего — в понимании времени: на записях 20–60 минут Intersection-over-Union локализации событий 48.3 против ~0 у Voxtral, Phi-4 и Qwen3-Omni. Держит контекст до 2 часов аудио 🔘 Отлично понимает русский: RuBQ-Audio 60.0 (против 43.7
from transformers import pipeline; pipeline(model="ai-sage/GigaChat3.1-Audio-10B-A1.8B")
| Installs into | transformers, python |
| Type | Model |
| Section | Models & platforms / text-generation |
| Pricing | open source |
| Platform | Web only |
| Hosting | cloud |
| Install | package |
| Installs into | transformers, python |
| Site language | en |
| Vendor | ai-sage |
| Views | 166 465 |
| Launched | 2026-07-13 |