Google представила обновлённую модель голосового агента Gemini 2.5 Flash Native Audio
Google анонсировала выход обновлённой модели голосового агента под названием Gemini 2.5 Flash Native Audio, которая показала лучшие результаты по сравнению с моделью gpt-realtime от OpenAI в тестах на сложные функциональные вызовы. В ходе тестирования ComplexFuncBench Audio новая модель набрала 71,5%, в то время как gpt-realtime — лишь 66,5%. Также сообщается о повышении точности следования инструкциям разработчиков до 90%, что значительно выше предыдущих 84%. Модель улучшила удержание контекста в многоходовых диалогах и лучше определяет моменты для вызова внешних функций, интегрируя результаты в разговор. Gemini 2.5 уже используется в приложениях Gemini и Search Live, заменяя каскадную архитектуру на нативное аудио. Доступ к модели получат разработчики через Google AI Studio, Vertex AI и Gemini API. Среди первых пользователей — крупнейший ипотечный брокер США United Wholesale Mortgage, а голосовой помощник Mia на базе Gemini уже помог оформить более 14 000 кредитов. В дополнение к этому Google запустила бета-версию синхронного перевода речи в Google Translate, поддерживающего более 70 языков.