ai-sage/GigaChat3.1-Audio-10B-A1.8B

huggingface.co
Visit site

Модель text-generation · лицензия mit

GigaChat Audio и GigaAM Multilingual: новые Open Source модели с поддержкой длинного контекста и языков СНГ 🔥 Полноценные audio-native LLM — пока редкость в опенсорсе, а почти весь прогресс в Speech AI сфокусирован на английском языке и коротких аудио. Качество существующих открытых моделей резко деградирует на low-resource языках и длинных контекстах Мы решили исправить обе проблемы и выкладываем в открытый доступ сразу две большие работы: расширенную версию GigaAM и новую GigaChat Audio с поддержкой длинных контекстов. Ценность обеих моделей и предложенных методов уже подтвердило научное сообщество — наши статьи приняли на главную мировую конференцию по речевым технологиям Interspeech 2026 GigaAM Multilingual Расширение нашей SOTA-модели распознавания речи на казахский, киргизский, узбекский и английский 🔘 Self-supervised Audio Encoder (240M / 600M) — предобучен на 2M часов речи на 70+ языках с фокусом на СНГ. Адаптируется к новым языкам быстрее и дешевле, чем Whisper и Omnilingual: на грузинском и башкирском дообучились с одного Common Voice до Word Error Rate ~4% — против 11%+ у Whisper Encoder 🔘 Multilingual CTC ASR (240M / 600M) — дообучены на 50k часов мультидоменной речи (ru/en/uz/ky/kk). Превосходят Whisper, Seamless и Omnilingual; даже компактная 240M обгоняет Whisper Large v3 и Omnilingual 1B при кратно меньшем размере (средний WER 12.2% против 14%+) 📖 arXiv 🤗 ai-sage/GigaAM-Multilingual 👩‍💻 salute-developers/GigaAM GigaChat Audio Audio-native LLM на базе GigaAM Multilingual и GigaChat3.1-10B-A1.8B. Поддерживает multi-turn диалог, классификацию аудио, перевод и распознавание речи, и temporal grounding — локализацию событий во времени, описание интервала аудио и суммаризацию с временными метками 🔘 Сильнее всего — в понимании времени: на записях 20–60 минут Intersection-over-Union локализации событий 48.3 против ~0 у Voxtral, Phi-4 и Qwen3-Omni. Держит контекст до 2 часов аудио 🔘 Отлично понимает русский: RuBQ-Audio 60.0 (против 43.7

Installation

from transformers import pipeline; pipeline(model="ai-sage/GigaChat3.1-Audio-10B-A1.8B")
Installs intotransformers, python
Not sure where to start — ask an assistant to walk you through:

Specs

Type Model
SectionModels & platforms / text-generation
Pricing open source
Platform Web only
Hostingcloud
Installpackage
Installs intotransformers, python
Site languageen
Vendorai-sage
Views166 465
Launched2026-07-13

Found in sources

Similar in «Models & platforms»

Submit a site to the catalog

Just send the link — we will work out the rest.

We will review what you send and add it to the catalog if it fits.

Not sure how to implement it? We can help

Tell us about your task — we will pick the tools and suggest where to start.

0 / 5000
Verification code

Fields marked with an asterisk are required. Your data is used only to reply.