Компания Google представила Gemini 3.5 Live Translate — новую аудиомодель, обеспечивающую почти синхронный перевод речи в режиме реального времени. Система поддерживает более 70 языков и работает по принципу прямого перевода «речь в речь» (speech-to-speech), сохраняя при этом темп, интонацию и индивидуальные особенности голоса спикера.
Как работает Gemini 3.5 Live Translate
В основе разработки лежит отказ от классического «построчного» перевода, при котором система ожидает завершения предложения. Модель анализирует аудиопоток по мере его поступления, начиная процесс перевода с минимальной задержкой. Такой подход позволяет минимизировать паузы в диалоге и сделать общение более естественным, хотя алгоритм постоянно балансирует между скоростью отклика и точностью, требующей контекстного анализа.
Google отмечает, что модель способна самостоятельно определять язык без предварительной настройки и эффективно справляется с фоновым шумом, что важно для использования в условиях лекций, трансляций или деловых звонков.

Интеграция в сервисы и мобильные приложения
Технология становится частью экосистемы Google. Пользователи мобильных устройств на Android и iOS получат доступ к Live Translate в приложении Google Translate — при подключении наушников перевод будет транслироваться непосредственно в уши. В версии для Android дополнительно появится «режим прослушивания», позволяющий выводить перевод через динамик смартфона, что имитирует обычный телефонный разговор.
Для корпоративных клиентов интеграция Gemini 3.5 Live Translate запланирована в платформе Google Meet. На первом этапе функция будет доступна бизнес-пользователям Google Workspace в рамках закрытого тестирования, а полноценный запуск ожидается до конца текущего года.
API для разработчиков и безопасность
Google активно расширяет возможности сторонних сервисов через Gemini Live API. Среди первых партнеров, внедривших инструменты синхронного перевода и дубляжа, значатся платформы Agora, Fishjam, LiveKit, Pipecat и Vision Agents. Например, сервис такси Grab уже применяет эту технологию для устранения языкового барьера между водителями и пассажирами в многоязычной среде.
Отдельное внимание уделено вопросам безопасности и борьбы с дипфейками. Весь аудиоконтент, созданный нейросетью, маркируется водяным знаком SynthID. Эта скрытая метка позволяет идентифицировать синтетическую речь, снижая риск использования модели для создания мошеннических аудиозаписей.






