Модель automatic-speech-recognition · лицензия apache-2.0
В OpenRouter приехали Qwen3-ASR, распознавание речи на 0,6 и 1,7 миллиарда параметров. Сами модели Qwen выложила ещё в конце января под Apache 2.0, теперь их можно дёргать по API без своего сервера: 0,00018 доллара за минуту аудио у младшей и 0,00048 у старшей. Обе понимают 30 языков и 22 китайских диалекта, сами определяют язык, работают в потоке и офлайн, принимают до 20 минут аудио за раз и вытягивают пение и речь поверх музыки. Русский в списке есть. По русскому в техотчёте 1.7B даёт WER 5,99% на FLEURS и 8,28% на CommonVoice, то есть примерно шесть и восемь неверно распознанных слов из ста. Младшая 0.6B заметно слабее, 9,91 и 14,07. Закрытая Qwen3-ASR-Flash точнее обеих, 4,81 и 5,73. Прямого сравнения с Whisper по-русски в отчёте нет, а на общей таблице по 30 языкам Whisper large-v3 старшую модель обходит, 8,16 против 12,60. Берут они скоростью. На одной видеокарте 1.7B прожёвывает около 67 минут аудио за минуту работы, 0.6B около 108, а в пакетном режиме на 128 потоках счёт идёт на тысячи. В независимом русском тесте на маке у 0.6B были ошибки в именах и пропадала пунктуация, так что на созвонах с терминами младшую лучше проверять. @neuro_channel
from transformers import pipeline; pipeline(model="Qwen/Qwen3-ASR-1.7B")
| Installs into | transformers, python |
| Type | Model |
| Section | Models & platforms / automatic-speech-recognition |
| Pricing | open source |
| Platform | Self-hosted |
| Systems | cli, docker, api |
| Hosting | cloud |
| Install | package |
| Installs into | transformers, python |
| Site language | en |
| Vendor | Qwen |
| Views | 4 445 196 |
| Launched | 2026-01-28 |