Компания Google анонсировала запуск модели Gemini 2.5 Flash Native Audio, предназначенной для голосовых ассистентов. В ходе тестирования ComplexFuncBench Audio, оценивающего выполнение многошаговых функциональных вызовов, новая модель показала результат в 71,5%, что значительно превосходит 66,5% модели gpt-realtime от OpenAI. По данным Google, точность выполнения инструкций разработчиков возросла до 90% (ранее было 84%), а также улучшилось удержание контекста в диалогах. Модель интегрирована в голосовой режим приложений Gemini и Search Live, впервые обеспечив нативное аудио. Разработчики могут использовать Gemini 2.5 Flash Native Audio через Google AI Studio и Vertex AI. Среди первых пользователей — United Wholesale Mortgage, где голосовой ассистент Mia помог оформить более 14 000 кредитов. Также Google запустила бета-версию синхронного перевода речи в Google Translate, поддерживающую более 70 языков и работающую в двух режимах. На данный момент функция доступна на Android в США, Мексике и Индии, а для iOS она появится в 2026 году.