Про це повідомляє видання Neowin.
Компанія OpenAI розширила свій API двома новими інструментами транскрипції — GPT-Live-Transcribe та GPT-Transcribe. Перша розроблена для завдань у режимі реального часу з мінімальною затримкою, тоді як друга орієнтована на обробку готових аудіофайлів у пакетному режимі. Головне нововведення обох моделей — здатність враховувати довільний контекст запису (галузеву термінологію, спеціальні ключові слова, очікувані мови та попередньо транскрибовані репліки).
За даними OpenAI, підтримка контексту дозволила підвищити семантичну точність із 38,5% до 44,6% для GPT-Live-Transcribe та з 41,6% до 45,2% для GPT-Transcribe. У тестах на реальних аудіозаписах рівень помилок GPT-Live-Transcribe знизився до 9,60% (проти 11,65% у GPT-Realtime-Whisper), а GPT-Transcribe показала рівень помилок 8,98% порівняно з 15,21% у Whisper-1. Згідно з оцінкою Artificial Analysis, рівень помилок GPT-Transcribe виявився ще нижчим і склав 3,31%, а вартість використання становить $4,50 за 1 000 хвилин.
We’re introducing two new transcription models in the API:
• GPT-Live-Transcribe: built for low-latency live transcription.
• GPT-Transcribe: optimized for asynchronous transcription of completed audio files and batch workloads.Both models better understand context and… pic.twitter.com/T4rQpKaGmk
— OpenAI Developers (@OpenAIDevs) July 28, 2026
У той самий час Alibaba презентувала моделі Qwen-Audio-3.0-Realtime Plus та Flash, орієнтовані на прямий формат взаємодії «мова-мова». Вони підтримують повнодуплексний режим, що дозволяє користувачеві перебивати співрозмовника-ШІ прямо під час виступу, а також дають змогу викликати зовнішні функції й використовувати власні клоновані голоси.
За даними індексу Speech-to-Speech від Artificial Analysis, модель Qwen-Audio-3.0-Realtime Plus посіла перше місце з результатом 84,1%, випередивши модель GPT-Realtime-2.1 High від OpenAI, яка набрала 79,1%. Китайська модель обійшла конкурента в тестах на логічне мислення та динаміку розмови. Втім, слабким місцем розробки Alibaba залишається затримка: час до першого аудіосигналу становить близько 4 секунд проти 1,14 секунди в аналозі від OpenAI.
Раніше науковий керівник компанії DeepL Штефан Мескен розповів, що штучний інтелект у голосовому перекладі долає етап «моторошної долини» та досягає рівня природного спілкування зі збереженням емоцій та інтонацій. Завдяки новим технологіям люди зможуть вільно розмовляти рідною мовою без бар’єрів за допомогою смарт-окулярів чи телефонів.
/
Американська OpenAI та китайська Alibaba синхронно оголосили про реліз нових моделей штучного інтелекту, призначених для обробки та генерації голосу. Оновлення охоплюють як рішення для миттєвого перетворення мовлення на текст під час живих розмов, так і повноцінні моделі для прямих діалогів між користувачем і ШІ.




