ახალი მოდელები რეალურ დროში ტრანსკრიფციასა და ხმის გენერირებას უზრუნველყოფენ.
Microsoft erweitert KI-Modellfamilie MAI um drei Audio-Modelle
წყარო: heise online. ქართული თარგმანი — შიკრიკი.

ტექსტი ავტომატურად ითარგმნა. წყარო: heise online.
1 ოქტომბერს გამოქვეყნებული მოდელები ძირითადად ხმოვანი აგენტების შესაქმნელადაა განკუთვნილი. სამივე მოდელმა რეალურ დროში ტრანსკრიფცია და მეტყველების გენერირება უნდა უზრუნველყოს.
MAI-Transcribe-2-Streaming MAI-ს ოჯახის პირველი ნაკადური მოდელია. მას 60 ენა ესმის და სალაპარაკო ენას ავტომატურად, უწყვეტად ამოიცნობს. შესაბამისად, ტრანსკრიფციისას ენის შეცვლაც შესაძლებელია. Microsoft პირველ წინასწარ შედეგებს დაახლოებით 100 მილიწამში იძლევა. მეტი კონტექსტის მიღების შემდეგ მოდელი შუალედურ შედეგებს ასწორებს. Artificial Analysis-ის საორიენტაციო ტესტების პლატფორმაზე მოდელი სიზუსტით პირველ ადგილზეა, როგორც საბოლოო, ისე წინასწარი ტრანსკრიფციების მიხედვით. Microsoft-ის შიდა გაზომვების თანახმად, სიტყვები ტრანსკრიფციაში ორჯერ უფრო სწრაფად ჩნდება, ვიდრე უსახელოდ დატოვებულ „უახლოეს კონკურენტთან“. Artificial Analysis-ზე სიზუსტით მეორე ადგილზე xAI-ს Grok Voice Transcribe 2.0 გავიდა.
Microsoft შესაძლო გამოყენების მაგალითებად ხმოვან აგენტებს ასახელებს. მათ წინადადების დასრულებამდე მსჯელობის დაწყება ან ხელსაწყოების გამოძახება შეუძლიათ. სხვა მაგალითებია პირდაპირი სუბტიტრები და კარნახის ფუნქციები. Microsoft მოდელს წლის ბოლომდე საწყისი ფასით, აუდიოს საათში 0,54 აშშ დოლარად, დაახლოებით 48 ცენტად, შესთავაზებს. შემდგომი ფასი ჯერ უცნობია. Microsoft-მა აუდიოს სფეროში პირველი ნაბიჯები ჯერ კიდევ 2025 წლის აგვისტოში, მეტყველების გენერირების MAI-Voice-1 მოდელით გადადგა.
ტექსტიდან მეტყველების წარმომქმნელ MAI-Voice-2.1 მოდელს 23 ენა შეუძლია. მას გამომავალი მეტყველების გენერირებისას ენებს შორის გადართვაც შეუძლია. Microsoft-ის განცხადებით, მოდელი თითოეულ ენაზე მშობლიური ენისთვის დამახასიათებელი აქცენტით საუბრობს. MAI Playground-ის „Chatter“ სადემონსტრაციო აპში ჩატარებულმა ცდებმა ეს გერმანული მეტყველებისთვის დაადასტურა. ფასი 1 მილიონ სიმბოლოზე 22 აშშ დოლარია.
Flash-ის ვარიანტი უფრო იაფია და 1 მილიონ სიმბოლოზე 15 აშშ დოლარი ღირს. მას იგივე ენები და ხმები აქვს. მოდელმა 45-წამიანი აუდიოსთვის თავიდან ბოლომდე 150-მილიწამიანი დაყოვნება უნდა უზრუნველყოს, რაც საკმაოდ გამართულ საუბარს შესაძლებელს გახდის. Microsoft Flash-ს რეალური დროის აგენტებისთვის, სატელეფონო ცენტრებისა და სატელეფონო მენიუებისთვის განიხილავს. უფრო ძვირი მოდელი აუდიოწიგნების, პოდკასტებისა და გახმოვანების მსგავსი ხანგრძლივი მასალებისთვისაა განკუთვნილი. ასეთ შემთხვევებში ხმა დიდ მონაკვეთებზე თანმიმდევრული უნდა დარჩეს. Microsoft ორ ვარიანტს შორის გაზომვად ხარისხობრივ განსხვავებებს არ ასახელებს.
ორივე მოდელს ყველა მხარდაჭერილ ენაზე ხმის კლონირება უნდა შეეძლოს. Microsoft-ის თქმით, ამისთვის 5-დან 60 წამამდე საცნობარო აუდიო საკმარისია. ბოროტად გამოყენების თავიდან ასაცილებლად ფუნქციაზე წვდომა შეზღუდულია. დეველოპერებმა Microsoft-ის შემოწმება უნდა გაიარონ და იმ ადამიანის აუდიოთანხმობა ატვირთონ, რომლის ხმაც უნდა დაკლონონ.

WTF: KI-Regeln: Trump und Tech-Riesen unterschreiben gemeinsame Erklärung
სამივე მოდელი Microsoft Foundry-ს, MAI Playground-ის, Vercel-ისა და Azure Voice Live-ის მეშვეობითაა ხელმისაწვდომი. ორივე ხმოვანი მოდელი დამატებით OpenRouter-ზეც გავრცელდა. LiveKit-ში ინტეგრაცია მოგვიანებით იგეგმება.
Microsoft-ის მოდელთა ოჯახი სწრაფად იზრდება. მანამდე უკვე გამოვიდა MAI-Transcribe-2, MAI-Image-2.6, MAI-Thinking-1 და MAI-Code-1.1-Flash. ამ მოდელებით Microsoft OpenAI-ზე ნაკლებად დამოკიდებული ხდება. კომპანიებმა თანამშრომლობა 2025 წლის ოქტომბერში შეცვლილი პარტნიორობის წესებით განაახლეს. MAI-Code-1.1-Flash უკვე GitHub Copilot-სა და VS Code-ში გამოიყენება. Microsoft-მა უსაფრთხოების სფეროსთვის ავტომატურად სისუსტეების აღმომჩენი სპეციალიზებული MAI-Cyber-1-Flash მოდელიც წარადგინა. ჯერჯერობით უცნობია, როდის და როგორ მოხვდება ახალი აუდიომოდელები Copilot-ის, Teams-ისა და Windows-ის მსგავს პროდუქტებში. Microsoft რეალურ დროში მეტყველების ამოცნობას Foundry Tools-ში Azure Speech-ის მეშვეობით დიდი ხანია სთავაზობს. თუმცა საკუთარი ნაკადური მოდელით კომპანია ახლა სპეციალიზებულ მომწოდებლებს პირდაპირ უპირისპირდება. ამ ბაზარზე, სხვებთან ერთად, ElevenLabs, Deepgram, AssemblyAI, Google, OpenAI და xAI კონკურირებენ.
შეადარე თარგმანი გამოცემის ორიგინალურ ტექსტს.
გამოქვეყნდა 2 ოქტომბერი, 2026

Ransomwaregruppe Killsec ausgehoben: Teenager als Hauptverdächtiger

So tracken uns unsere Autos: Studienergebnisse von 21 PKWs

AI music maker Suno now generates spoken words

Your Driverless Cab Is Spying on You

A Flaw in ChatGPT’s Mac App Could Have Let Hackers Grab Sensitive Data
კომენტარი (0)
გაგვიზიარე შენი აზრი.
კომენტარები ავტომატურად მოწმდება.
აზრის გასაზიარებლად შექმენი ანგარიში ან შედი.
კომენტარები ჯერ არ არის. დაწერე პირველი.