# Alibaba представляет семейство моделей Qwen-Audio-3.1 и снижает цены на голосовой AI API до 95 процентов на конференции Apsara

Source: TechNewsList (https://technewslist.com)
Canonical URL: https://technewslist.com/ru/article/alibaba-qwen-audio-3-1-voice-ai-api-price-cuts-2026-09-26-morning-ru
Section: AI (https://technewslist.com/ru/ai)
Author: TechNewsList
Language: ru
Published: 2026-09-26T10:48:01.53+00:00
Updated: 2026-09-26T10:48:01.704777+00:00

> Alibaba Cloud официально представила семейство базовых моделей Qwen-Audio-3.1 на конференции Apsara, представив архитектуры ASR-Next и TTS-Next, одновременно снизив цены на API распознавания речи и потоковой передачи голоса до 95 процентов.

## TL;DR
- Alibaba Cloud представила семейство Qwen-Audio-3.1 из пяти моделей на своей ежегодной конференции Apsara в Ханчжоу.
- Цены на API для автоматического распознавания речи упали на 95 процентов, а скорость потоковой передачи голоса в реальном времени упала на 85 процентов.
- Новая архитектура ASR-Next выполняет прямой анализ акустических характеристик, обнаружение эмоций говорящего и сегментацию шума в скрытом пространстве.
- TTS-Next обеспечивает однопроходный синтез, сочетающий естественную речь, акустику окружающей среды и интерактивные слуховые сигналы.

## Key points
- Пакет Qwen-Audio-3.1 включает в себя специализированные базовые модели, оптимизированные для периферийного развертывания с малой задержкой и параллельной работы на крупных предприятиях.
- Цены на автоматическое распознавание речи упали до долей цента за час аудио, что бросает вызов глобальным поставщикам проприетарных речевых API.
- Задержка двунаправленного разговора в реальном времени сократилась до менее 200 миллисекунд при вводе на китайском, английском и региональных диалектах.
- Генеральный директор Alibaba Cloud Эдди Ву назвал агрессивное снижение цен инициативой по превращению голосового интеллекта в товар для глобального корпоративного программного обеспечения.
- Коммерческая доступность началась сразу же в Alibaba Cloud Model Studio, а контрольные точки моделей с открытыми весами были опубликованы на ModelScope.

## Что произошло

На своей флагманской конференции Apsara в Ханчжоу 25 сентября 2026 года Alibaba Cloud объявила об официальном выпуске семейства моделей Qwen-Audio-3.1, представив пять новых мультимодальных моделей речи и акустического мышления. Помимо раскрытия архитектуры, компания радикально снизила цены на свой портфель речевых API, снизив скорость автоматического распознавания речи до 95 процентов, затраты на двунаправленное голосовое взаимодействие в реальном времени на 85 процентов и плату за синтез речи на 70 процентов. Агрессивное изменение цен меняет экономическую основу для развертывания производственных голосовых агентов в экосистемах корпоративного программного обеспечения.

Центральным элементом технического релиза является представление двух основных архитектур моделей, получивших названия ASR-Next и TTS-Next. В отличие от обычных речевых конвейеров, которые полагаются на отдельную фонетическую транскрипцию, рассуждение языковой модели и модули акустического вокодера, архитектура Qwen-Audio-3.1 обрабатывает непрерывные аудиопотоки в общем скрытом пространстве. Эта консолидированная топология позволяет системе понимать невербальные слуховые сигналы, распознавать намерения прерывания разговора и синтезировать выразительный диалог с контекстуальной акустической осведомленностью.

## Почему это важно

Экономическая переоценка, объявленная в Ханчжоу, устраняет давний финансовый барьер для разработчиков, создающих голосовые агенты в реальном времени. Исторически развертывание интерактивных голосовых помощников в коммерческих масштабах ограничивалось высокой поминутной платой за обработку звука и усугубляющейся задержкой в ​​многомодельных конвейерах вывода. Снижая затраты на распознавание речи до ничтожных долей цента за разговор, Alibaba пытается позиционировать Qwen как акустическую среду выполнения по умолчанию для автоматизации поддержки клиентов, перевода в реальном времени и агентских помощников.

Кроме того, этот шаг обостряет ценовую конкуренцию среди мировых поставщиков искусственного интеллекта. В то время как западные разработчики фундаментальных моделей сосредоточили капитальные затраты на передовых ориентирах, китайские гипермасштабирующие компании используют эффективность инфраструктуры для стимулирования коммерциализации мультимодальных конечных точек. Архитекторы корпоративного программного обеспечения, разрабатывающие международные голосовые приложения, теперь могут использовать модели открытого веса и сверхнизкие по стоимости управляемые конечные точки, усиливая сжатие прибыли для автономных поставщиков систем преобразования речи в текст и синтетической речи.

![Технологический центр Alibaba Binjiang, в котором размещены кластеры облачных вычислений и корпоративные системы обработки речи с использованием искусственного интеллекта.](https://rkhynbcsbnkkcwgexzwg.supabase.co/storage/v1/object/public/media/api/1790400001587-y1axrs-alibaba-qwen-audio-3-1-voice-ai-api-price-cuts-2026-09-26-morning-inside-1-a268c744e4.webp)

## Технические детали

Архитектурные улучшения, лежащие в основе Qwen-Audio-3.1, основаны на кодере непрерывного аудио, обученном более чем 500 000 часов многодиалектной речи и контекстуальному звуку окружающей среды. Модель ASR-Next выходит за рамки лексической точности, извлекая акустические представления, которые представляют собой эмоциональные изменения, фоновые акустические помехи и динамику очередности говорящего. В ходе эталонных оценок модель продемонстрировала 34-процентное снижение количества ошибок в словах в шумной промышленной среде и при перекрывающихся диалогах с несколькими говорящими по сравнению с предыдущими версиями.

Генеративный компонент TTS-Next действует как механизм выразительного акустического синтеза, способный выполнять однопроходный рендеринг. Вместо того, чтобы требовать отдельных последующих фильтров постобработки для создания естественных пауз или окружающей акустики, нейронный декодер генерирует речевые сигналы одновременно со случайными аудиоэлементами, такими как ритмы дыхания, сдвиги акцента и отзывчивый смех. Унифицированная схема токенизации позволяет модели динамически переключаться между языками, обеспечивая быстрое двуязычное переключение кода между китайским и английским без фонетических колебаний или искажений каденции.

Задержка вывода также была оптимизирована для облачных развертываний с высоким уровнем параллелизма. Alibaba разработала специализированные ядра CUDA, которые ускоряют вычисления встраивания вращающихся позиций и доступ к кэшу значений ключей для непрерывного аудиоконтекста. В ходе производственного тестирования в Alibaba Cloud Model Studio конечная точка потоковой передачи достигла задержки до первого аудиофрагмента в 180 миллисекунд, что соответствует строгим требованиям к быстродействию, предъявляемым к живым телефонным приложениям и средам выполнения интерактивных аватаров.

![В штаб-квартире Alibaba Center в Ханчжоу проводятся коммерческие облачные операции и конференции разработчиков.](https://rkhynbcsbnkkcwgexzwg.supabase.co/storage/v1/object/public/media/api/1790400007057-37723a-alibaba-qwen-audio-3-1-voice-ai-api-price-cuts-2026-09-26-morning-inside-2-0b2ef1f9bf.webp)

## Влияние на рынок и отрасль

Непосредственным коммерческим последствием заявления Alibaba является цикл пересмотра цен в секторе разговорной разведки. Независимые поставщики голосового искусственного интеллекта, платформы корпоративных контакт-центров и телекоммуникационные агрегаторы переоценивают свои затраты на инфраструктуру. Ожидается, что конкуренты гипермасштабируемых компаний в Азиатско-Тихоокеанском регионе, в том числе Tencent Cloud и Baidu AI Cloud, внесут конкурентоспособные пересмотры тарифов, чтобы предотвратить переход разработчиков на платформу Alibaba Model Studio.

Для разработчиков корпоративного программного обеспечения демократизация недорогих голосовых токенов обеспечивает массовое внедрение внешних голосовых интерфейсов на потребительских устройствах, в автомобильных кабинах и промышленном оборудовании. Компании, которые раньше ограничивали возможности интерактивной речи премиальными уровнями подписки, теперь могут включать непрерывную обработку голоса в базовые предложения продуктов, не ставя под угрозу валовую прибыль.

Модель двойного развертывания — сочетание весов открытых весов, распределяемых через ModelScope и Hugging Face, вместе с управляемыми API-интерфейсами на хостинге — еще больше расширяет число разработчиков Alibaba. Предоставляя организациям возможность точно настраивать компактные речевые модели на основе собственных наборов данных организации, а также предлагая управляемые облачные конечные точки для увеличения пропускной способности, Alibaba укрепляет свои позиции в качестве основного международного конкурента в базовой инфраструктуре искусственного интеллекта.

## За чем следить дальше

Отраслевые обозреватели будут отслеживать модели миграции разработчиков в четвертом квартале 2026 года, оценивая, способствует ли ценовое наступление Alibaba устойчивому потреблению API за пределами внутреннего рынка. Важнейшими индикаторами будут показатели внедрения среди трансграничных платформ электронной коммерции, поставщиков услуг поддержки клиентов и международных игровых студий, реализующих голосовой диалог неигровых персонажей в реальном времени.

Регулирующее внимание к безопасности синтеза голоса также будет усилено. Поскольку TTS-Next обеспечивает быстрое клонирование голоса на основе коротких эталонных аудиосэмплов, корпоративные группы по соблюдению нормативных требований оценят эффективность криптографических водяных знаков и защиты от спуфинга, встроенных в общественные контрольно-пропускные пункты для предотвращения искусственного голосового мошенничества в каналах телебанкинга.

Наконец, рынок будет наблюдать, отреагируют ли конкурирующие поставщики базовых моделей, такие как OpenAI, Google и Anthropic, выпусками специальных речевых моделей и пересмотренными графиками комиссий за аудиотокены. Если мультимодальная обработка голоса продолжит смещаться в сторону интегрированных базовых моделей, рынок автономной синтетической речи подвергнется быстрой консолидации в более широкие контракты на облачные платформы.

## Источники

* [Официальное объявление Alibaba Cloud](https://www.alibabacloud.com/blog/alibaba-cloud-apsara-conference-2026-qwen-audio-launch_601248) — официальный корпоративный релиз, документирующий технические характеристики Qwen-Audio-3.1, акустические тесты ASR-Next и корректировки коммерческих ставок API.
* [South China Morning Post Technology](https://www.scmp.com/tech/big-tech/article/3279841/alibaba-slashes-ai-voice-model-prices-up-95-percent-apsara-conference) — независимая технологическая журналистика, анализирующая конкурентное ценовое давление между провайдерами гипермасштабных облачных вычислений и корпоративными рынками диалогового искусственного интеллекта.
* [TechNode Enterprise Analysis](https://technode.com/2026/09/25/alibaba-launches-qwen-audio-3-1-and-drastically-cuts-voice-api-pricing/) — анализ технической архитектуры, оценивающий моделирование эмоций в скрытом пространстве, точность двуязычного переключения кода и унифицированные конвейеры синтеза звука.

Mentions: Алибаба Облако, Команда Квен, Эдди Ву, Апсара Конференция, МодельОбласть

## Sources
- [Официальное объявление Alibaba Cloud](https://www.alibabacloud.com/blog/alibaba-cloud-apsara-conference-2026-qwen-audio-launch_601248)
- [Южно-Китайская технология Morning Post](https://www.scmp.com/tech/big-tech/article/3279841/alibaba-slashes-ai-voice-model-prices-up-95-percent-apsara-conference)
- [TechNode Анализ предприятия](https://technode.com/2026/09/25/alibaba-launches-qwen-audio-3-1-and-drastically-cuts-voice-api-pricing/)