Ведущая мировая компания в области искусственного интеллекта OpenAI добавила новейшие функции голосового интеллекта в свою систему API, предназначенную для разработчиков. С внедрением новых моделей GPT-Realtime-2, GPT-Realtime-Translate и GPT-Realtime-Whisper появилась возможность создавать приложения нового поколения, способные общаться с пользователями на естественном языке, мгновенно преобразовывать речь в текст и осуществлять перевод в режиме реального времени.
Логика уровня GPT-5 и увеличенный объем контекста
Флагманская модель GPT-Realtime-2, в отличие от предыдущей версии 1.5, оснащена способностью к «логическому мышлению уровня GPT-5» (reasoning) для решения более сложных задач. Согласно пресс-релизу OpenAI, новая модель показала результат на 15,2% выше в тестах «Big Bench Audio» по сравнению со своей предшественницей. Кроме того, контекстное окно модели было увеличено с 32K до 128K. Это позволяет ИИ сохранять контекст в более длительных и сложных голосовых сессиях, а также выполнять несколько вызовов функций одновременно (например, информировать пользователя словами «сейчас проверяю календарь»).
Синхронный перевод и низкая задержка
Еще одна инновация, добавленная в API — GPT-Realtime-Translate, предоставляющая услуги перевода в реальном времени с той же скоростью, с которой говорит пользователь. Эта функция распознает на слух более 70 языков и может отвечать голосом на 13 языках. Более того, она не только переводит голос, но и мгновенно создает текстовую транскрипцию. В дополнение к этому, новая модель GPT-Realtime-Whisper обеспечивает транскрипцию с низкой задержкой (low latency), что идеально подходит для создания заметок на собраниях, живых субтитров и систем поддержки клиентов.
Тарификация услуг также была строго определена. Модели Translate и Whisper оплачиваются поминутно, в то время как GPT-Realtime-2 тарифицируется по расходу токенов. Установлено, что стоимость 1 миллиона токенов голосового ввода для GPT-Realtime-2 составляет 32 доллара, а для голосового вывода — 64 доллара.



