От стенографии к осмыслению: Google обновляет подход к распознаванию речи

От стенографии к осмыслению: Google обновляет подход к распознаванию речи
 

Компания Google представила модель распознавания речи Gemini 3.5 Transcribe, ознаменовавшую переход от простого механического фиксирования звуков к глубокому пониманию контекста и намерений говорящего. Новинка вошла в состав линейки Gemini Audio вместе с моделями Gemini 3.5 Live и Gemini 3.5 Live Experimental, расширяющими возможности голосового взаимодействия с искусственным интеллектом в реальном времени.

Главное отличие Gemini 3.5 Transcribe от традиционных систем распознавания речи заключается в способности интеллектуально редактировать устный поток прямо во время транскрипции. Алгоритм распознает оговорки и самоисправления говорящего, автоматически удаляет слова-паразиты, расставляет знаки препинания и преобразует хаотичную устную речь в структурированный, готовый к чтению текст.

Модель поддерживает более восьмидесяти пяти языков, уверенно справляется со смешанной многоязычной речью, позволяет подключать пользовательские словари для точного распознавания профессиональной терминологии, а для готовых аудиозаписей предоставляет пословные временные метки и разделение по дикторам.

Инструмент уже внедряется в ключевые пользовательские сервисы и среду разработки. Модель интегрирована в клавиатуру Gboard для Android и приложение Gemini для macOS, а также доступна разработчикам через Gemini API в режиме предварительного просмотра как для потокового аудио с минимальной задержкой, так и для файлов длительностью до одного часа. В ближайших планах компании значится интеграция технологии в браузер Chrome, что позволит пользователям надиктовывать текст, сообщения и команды в любые веб-формы.

Стратегический смысл этого релиза выходит далеко за рамки улучшения точности транскрипции. Google последовательно выстраивает голосовой интерфейс в качестве основного канала связи между пользователем и экосистемой искусственного интеллекта.

Встраивание интеллектуальной обработки голоса в повседневные рабочие инструменты, такие как браузер, почта, документы и экранная клавиатура, призвано сделать голосовое управление полноценной альтернативой клавиатурному вводу и закрепить за сервисами компании роль главного персонального ИИ-ассистента.

БОЛЬШЕ ИНФОРМАЦИИ

Email

sms_systems@inbox.ru

Телефон

+ 7 (985) 982-70-55

Если у вас есть инновационная идея, мы будем рады реализовать ее для Вас!

Специалисты нашей кампании и наши разработки для вас!