# Alibaba-მ წარმოადგინა Qwen-Audio-3.1 Model Family და Slashes Voice AI API ფასს 95 პროცენტამდე აფსარას კონფერენციაზე

Source: TechNewsList (https://technewslist.com)
Canonical URL: https://technewslist.com/ka/article/alibaba-qwen-audio-3-1-voice-ai-api-price-cuts-2026-09-26-morning-ka
Section: AI (https://technewslist.com/ka/ai)
Author: TechNewsList
Language: ka
Published: 2026-09-26T10:48:04.17+00:00
Updated: 2026-09-26T10:48:04.356962+00:00

> Alibaba Cloud-მა ოფიციალურად გამოუშვა Qwen-Audio-3.1 საძირკვლის მოდელების ოჯახი Apsara კონფერენციაზე, წარადგინა ASR-Next და TTS-Next არქიტექტურები, ხოლო მეტყველების ამოცნობისა და ხმის ნაკადის API ფასები 95 პროცენტით შემცირდა.

## TL;DR
- Alibaba Cloud-მა გამოუშვა ხუთმოდელიანი Qwen-Audio-3.1 ოჯახი აფსარას ყოველწლიურ კონფერენციაზე ჰანჯოუში.
- მეტყველების ავტომატური ამოცნობის API-ის ფასები დაეცა 95 პროცენტით, ხოლო რეალურ დროში ხმის ნაკადის სიჩქარე 85 პროცენტით დაეცა.
- ახალი ASR-Next არქიტექტურა ასრულებს პირდაპირ აკუსტიკური მახასიათებლების ანალიზს, დინამიკის ემოციების ამოცნობას და ხმაურის სეგმენტაციას ლატენტურ სივრცეში.
- TTS-Next საშუალებას აძლევს ერთგადასასვლელ სინთეზს, რომელიც აერთიანებს ბუნებრივ მეტყველებას, ატმოსფერულ აკუსტიკას და ინტერაქტიული სმენის სიგნალებს.

## Key points
- Qwen-Audio-3.1 კომპლექტი მოიცავს სპეციალიზებულ საძირკვლის მოდელებს, რომლებიც ოპტიმიზირებულია დაბალი შეყოვნების ზღვარზე განლაგებისთვის და დიდი საწარმოს კონკურენტულობისთვის.
- მეტყველების ავტომატური ამოცნობის ფასი დაეცა აუდიოს საათში ცენტის ფრაქციებზე, რაც გამოწვევას უქმნის გლობალური საკუთრების მეტყველების API პროვაიდერებს.
- რეალურ დროში ორმხრივი საუბრის შეყოვნება შემცირდა 200 მილიწამზე ქვემოთ ჩინურ, ინგლისურ და რეგიონულ დიალექტზე შეყვანისას.
- Alibaba Cloud-ის აღმასრულებელმა დირექტორმა ედი ვუმ წარმოადგინა ფასების აგრესიული შემცირება, როგორც ინიციატივა გლობალური საწარმოს პროგრამული უზრუნველყოფისთვის ხმოვანი ინტელექტის გასაყიდად.
- კომერციული ხელმისაწვდომობა დაუყოვნებლივ დაიწყო Alibaba Cloud Model Studio-ზე ღია წონის მოდელის საგუშაგოებით, რომლებიც გამოვიდა ModelScope-ზე.

## რა მოხდა

2026 წლის 25 სექტემბერს, ჰანჯოუში, ფლაგმანურ აფსარა კონფერენციაზე, Alibaba Cloud-მა გამოაცხადა Qwen-Audio-3.1 მოდელის ოჯახის ოფიციალური გამოშვება, წარმოადგინა ხუთი ახალი მულტიმოდალური მეტყველების და აკუსტიკური მსჯელობის მოდელები. არქიტექტურული გამოვლენის პარალელურად, კომპანიამ დააწესა ფასების რადიკალური შემცირება მეტყველების API პორტფოლიოში, შეამცირა მეტყველების ავტომატური ამოცნობის სიხშირე 95 პროცენტამდე, რეალურ დროში ორმხრივი ხმის ურთიერთქმედების ხარჯები 85 პროცენტით და ტექსტიდან მეტყველების სინთეზის საფასური 70 პროცენტით. აგრესიული გადაფასება ცვლის ეკონომიკურ საფუძველს საწარმოს პროგრამული ეკოსისტემებში წარმოების ხმოვანი აგენტების განთავსებისთვის.

ტექნიკური გამოშვების ცენტრალური ნაწილია ორი ძირითადი მოდელის არქიტექტურის დანერგვა, სახელწოდებით ASR-Next და TTS-Next. ჩვეულებრივი მეტყველების მილსადენებისგან განსხვავებით, რომლებიც ეყრდნობა ცალკეულ ფონეტიკურ ტრანსკრიფციას, ენის მოდელის მსჯელობას და აკუსტიკური ვოკოდერის მოდულებს, Qwen-Audio-3.1 არქიტექტურა ამუშავებს უწყვეტ აუდიო ნაკადებს საერთო ფარულ სივრცეში. ეს კონსოლიდირებული ტოპოლოგია სისტემას საშუალებას აძლევს გაიგოს არავერბალური სმენის სიგნალები, გაარკვიოს საუბრის შეწყვეტის მიზნები და მოახდინოს ექსპრესიული დიალოგის სინთეზი კონტექსტური აკუსტიკური ცნობიერებით.

## რატომ არის მნიშვნელოვანი

Hangzhou-ში გამოცხადებული ეკონომიკური გადაფასება აღმოფხვრის გრძელვადიან ფინანსურ ბარიერს დეველოპერებისთვის, რომლებიც ქმნიან რეალურ დროში ხმის აგენტებს. ისტორიულად, კომერციული მასშტაბით ინტერაქტიული ხმოვანი ასისტენტების განლაგება შეზღუდული იყო წუთში აუდიო დამუშავების მკვეთრი გადასახადებით და შეფერხებით მრავალ მოდელის დასკვნის მილსადენებში. მეტყველების ამოცნობის ხარჯების კოლაფსირებით ცენტის უმნიშვნელო ფრაქციებზე თითო საუბრისას, Alibaba ცდილობს დააყენოს Qwen, როგორც ნაგულისხმევი აკუსტიკური გაშვების დრო მომხმარებელთა მხარდაჭერის ავტომატიზაციისთვის, რეალურ დროში თარგმნისა და აგენტური ასისტენტებისთვის.

გარდა ამისა, ეს ნაბიჯი ზრდის ფასების კონკურენციას გლობალურ ხელოვნური ინტელექტის პროვაიდერებს შორის. იმის გამო, რომ დასავლური ფონდის მოდელის შემქმნელებმა კაპიტალური დანახარჯები ფოკუსირდნენ სასაზღვრო მსჯელობის კრიტერიუმებზე, ჩინელი ჰიპერსკალერები იყენებენ ინფრასტრუქტურის ეფექტურობას მულტიმოდალური ბოლო წერტილების საქონელზე გასამყარებლად. საწარმოს პროგრამული არქიტექტორები, რომლებიც ქმნიან საერთაშორისო ხმოვან აპლიკაციებს, ახლა შეუძლიათ გამოიყენონ ღია წონის მოდელები და ულტრა დაბალფასიანი მართული საბოლოო წერტილები, გააძლიერონ ზღვრის შეკუმშვა დამოუკიდებელი მეტყველების ტექსტში და სინთეტიკური ხმის გამყიდველებისთვის.

![Alibaba Binjiang ტექნოლოგიურ ცენტრში განთავსებულია ღრუბლოვანი გამოთვლითი კლასტერები და საწარმოს AI მეტყველების დამუშავების სისტემები](https://rkhynbcsbnkkcwgexzwg.supabase.co/storage/v1/object/public/media/api/1790400001587-y1axrs-alibaba-qwen-audio-3-1-voice-ai-api-price-cuts-2026-09-26-morning-inside-1-a268c744e4.webp)

## ტექნიკური დეტალები

Qwen-Audio-3.1-ის საფუძვლად შექმნილი არქიტექტურული გაუმჯობესებები გამომდინარეობს უწყვეტი ნაკადის აუდიო კოდირებიდან, რომელიც გაწვრთნილია 500000 საათზე მეტ დიალექტურ მეტყველებასა და კონტექსტურ გარემო აუდიოზე. ASR-Next მოდელი სცილდება ლექსიკურ სიზუსტეს აკუსტიკური ჩაშენების ამოღებით, რომლებიც წარმოადგენენ ემოციურ გადახრას, ფონის აკუსტიკური ჩარევას და დინამიკის მობრუნების დინამიკას. საორიენტაციო შეფასებებში მოდელმა აჩვენა სიტყვის შეცდომის სიხშირის 34 პროცენტიანი შემცირება ხმაურიან ინდუსტრიულ გარემოში და მრავალ დინამიკზე გადახურულ დიალოგებში წინა ვერსიებთან შედარებით.

გენერაციული კომპონენტი, TTS-Next, ფუნქციონირებს, როგორც ექსპრესიული აკუსტიკური სინთეზის ძრავა, რომელსაც შეუძლია ერთჯერადი რენდერირება. ბუნებრივი პაუზების ან გარემოს აკუსტიკის წარმოქმნის ნაცვლად, ნეირონული დეკოდერი წარმოქმნის მეტყველების ტალღების ფორმებს შემთხვევითი აუდიო ელემენტების პარალელურად, როგორიცაა სუნთქვის რიტმები, აქცენტის ცვლა და პასუხისმგებელი სიცილი. ტოკენიზაციის ერთიანი სქემა საშუალებას აძლევს მოდელს გადართოს ენებს შორის დინამიურად, აწარმოოს სწრაფი ორენოვანი კოდის გადართვა ჩინურსა და ინგლისურს შორის ფონეტიკური ყოყმანის ან კადენციის დამახინჯების გარეშე.

დასკვნის შეყოვნება ასევე ოპტიმიზირებულია მაღალი კონკურენტული ღრუბლის განლაგებისთვის. Alibaba-მ დააპროექტა სპეციალიზებული CUDA ბირთვები, რომლებიც აჩქარებს მბრუნავი პოზიციის ჩაშენების გამოთვლებს და გასაღების მნიშვნელობის ქეში წვდომას უწყვეტი აუდიო კონტექსტებისთვის. Alibaba Cloud Model Studio-ზე წარმოების ბენჩმარკინგისას, სტრიმინგის ბოლო წერტილმა მიაღწია პირველი აუდიო ნაწილის შეყოვნებას 180 მილიწამამდე, რაც აკმაყოფილებდა მკაცრ რეაგირების მოთხოვნებს, რომლებიც მოთხოვნილია ცოცხალი სატელეფონო აპლიკაციებისა და ადამიანის ინტერაქტიული ავატარის მუშაობის დროს.

![Alibaba ცენტრის სათაო ოფისები Hangzhou-ში მასპინძლობს კომერციულ ღრუბლოვან ოპერაციებს და დეველოპერთა კონფერენციებს](https://rkhynbcsbnkkcwgexzwg.supabase.co/storage/v1/object/public/media/api/1790400007057-37723a-alibaba-qwen-audio-3-1-voice-ai-api-price-cuts-2026-09-26-morning-inside-2-0b2ef1f9bf.webp)

## გავლენა ბაზარზე და ინდუსტრიაზე

Alibaba-ს განცხადების უშუალო კომერციული შედეგი არის გადაფასების ციკლი სასაუბრო დაზვერვის სექტორში. ხმოვანი ხელოვნური ინტელექტის დამოუკიდებელი პროვაიდერები, საწარმოთა საკონტაქტო ცენტრის პლატფორმები და სატელეკომუნიკაციო აგრეგატორები ხელახლა აფასებენ თავიანთ ინფრასტრუქტურულ ხარჯებს. ჰიპერმასშტაბიანი კონკურენტები აზია-წყნარი ოკეანის რეგიონში, მათ შორის Tencent Cloud და Baidu AI Cloud, მოსალოდნელია, რომ შემოიტანონ კონკურენტული განაკვეთების ცვლილებები, რათა თავიდან აიცილონ დეველოპერების გადახვევა Alibaba-ს Model Studio პლატფორმაზე.

საწარმოს პროგრამული უზრუნველყოფის დეველოპერებისთვის, დაბალი ფასიანი ხმოვანი ჟეტონების დემოკრატიზაცია საშუალებას აძლევს გარემოს ხმის ინტერფეისების მასობრივ გავრცელებას სამომხმარებლო მოწყობილობებში, საავტომობილო კაბინებში და სამრეწველო აღჭურვილობაში. კომპანიებს, რომლებიც ადრე ზღუდავდნენ ინტერაქტიული მეტყველების შესაძლებლობებს პრემიუმ სააბონენტო დონეზე, ახლა შეუძლიათ უწყვეტი ხმის დამუშავება საბაზისო პროდუქციის შეთავაზებაში ჩართონ მთლიანი ზღვრების საფრთხის გარეშე.

ორმაგი განლაგების მოდელი - რომელიც აერთიანებს ღია წონებს, რომლებიც ნაწილდება ModelScope-ისა და Hugging Face-ის მეშვეობით, მასპინძელ მართულ API-ებთან ერთად - კიდევ უფრო აფართოებს Alibaba-ს დეველოპერის კვალს. საშუალებას აძლევს ორგანიზაციებს დააზუსტონ კომპაქტური მეტყველების მოდელები საკუთრებაში არსებული ორგანიზაციული მონაცემთა ნაკრებებზე და სთავაზობენ მართული ღრუბლის ბოლო წერტილებს ადიდებული სიმძლავრისთვის, Alibaba აძლიერებს თავის პოზიციას, როგორც პირველადი საერთაშორისო კონკურენტი ფონდის AI ინფრასტრუქტურაში.

## რას უნდა დავაკვირდეთ შემდეგ

ინდუსტრიის დამკვირვებლები მონიტორინგს გაუწევენ დეველოპერების მიგრაციის ნიმუშებს 2026 წლის მეოთხე კვარტალში, შეაფასებენ თუ არა Alibaba-ს ფასების შეურაცხმყოფელი დრაივები API-ს მოხმარებას შიდა ბაზრის გარეთ. გადამწყვეტი ინდიკატორები მოიცავს ტრანსსასაზღვრო ელექტრონული კომერციის პლატფორმებს, მომხმარებელთა მხარდაჭერის პროვაიდერებსა და საერთაშორისო სათამაშო სტუდიებს შორის, რომლებიც რეალურ დროში ახორციელებენ არამოთამაშის პერსონაჟების ხმოვან დიალოგს.

ასევე გაძლიერდება მარეგულირებელი კონტროლი ხმის სინთეზის უსაფრთხოების შესახებ. იმის გამო, რომ TTS-Next უზრუნველყოფს სწრაფ რამდენიმე დარტყმის ხმის კლონირების შესაძლებლობებს მოკლე საცნობარო აუდიო ნიმუშებიდან, საწარმოთა შესაბამისობის გუნდები შეაფასებენ კრიპტოგრაფიული წყლის მარკირებისა და გაყალბების საწინააღმდეგო მცველების ეფექტურობას, რომლებიც ჩაშენებულია საჯარო გამშვებ პუნქტებში, რათა თავიდან აიცილონ სინთეზური ხმოვანი თაღლითობა ტელებანკის არხებში.

დაბოლოს, ბაზარი დააკვირდება, რეაგირებენ თუ არა კონკურენტი ფონდის მოდელების პროვაიდერები, როგორიცაა OpenAI, Google და Anthropic, სპეციალური მეტყველების მოდელის გამოშვებებით და აუდიო ნიშნების საფასურის განახლებული განრიგით. თუ მულტიმოდალური ხმის დამუშავება გააგრძელებს ინტეგრირებულ საძირკვლის მოდელებზე გადასვლას, დამოუკიდებელი სინთეზური მეტყველების ბაზარი სწრაფ კონსოლიდაციას გაივლის უფრო ფართო პლატფორმის ღრუბლოვან კონტრაქტებში.

## წყაროები

* [Alibaba Cloud Official Announcement](https://www.alibabacloud.com/blog/alibaba-cloud-apsara-conference-2026-qwen-audio-launch_601248) - ოფიციალური კორპორატიული გამოშვება დოკუმენტირებული Qwen-Audio-3.1 ტექნიკური მახასიათებლებისა და ASR-ის რეგულირების სიჩქარის, acquisPI-ს და ASR-ის რეგულირების სიჩქარის, ASR-ის რეგულირების შესახებ.
* [South China Morning Post Technology](https://www.scmp.com/tech/big-tech/article/3279841/alibaba-slashes-ai-voice-model-prices-up-95-percent-apsara-conference) - დამოუკიდებელი ტექნოლოგიური ჟურნალისტიკა აანალიზებს კონკურენტულ ფასებს საწარმოთა ღრუბლოვან ბაზარზე და ჰიპერმასშტაბიანი საუბრისას.
* [TechNode Enterprise Analysis](https://technode.com/2026/09/25/alibaba-launches-qwen-audio-3-1-and-drastically-cuts-voice-api-pricing/) - ტექნიკური არქიტექტურის ავარია, რომელიც აფასებს ლატენტური სივრცის ემოციების კოდირებას, აუდიო-სივრცის ემოციების მოდელირებას, აუდიომოდელირებას. მილსადენები.

Mentions: ალიბაბა ღრუბელი, ქვენის გუნდი, ედი ვუ, აფსარას კონფერენცია, ModelScope

## Sources
- [Alibaba Cloud ოფიციალური განცხადება](https://www.alibabacloud.com/blog/alibaba-cloud-apsara-conference-2026-qwen-audio-launch_601248)
- [სამხრეთ ჩინეთის დილის პოსტის ტექნოლოგია](https://www.scmp.com/tech/big-tech/article/3279841/alibaba-slashes-ai-voice-model-prices-up-95-percent-apsara-conference)
- [TechNode Enterprise Analysis](https://technode.com/2026/09/25/alibaba-launches-qwen-audio-3-1-and-drastically-cuts-voice-api-pricing/)