Gemini 3.1 Flash Live: Новая аудиомодель Google с улучшенными показателями и водяными знаками

Что нового в Gemini 3.1 Flash Live
Google выпустила Gemini 3.1 Flash Live — свою самую качественную аудио- и голосовую модель, предназначенную для диалогов в реальном времени. Модель обеспечивает повышенную скорость и естественный ритм для голосовых AI-приложений.
Ключевые технические детали
- Результаты тестов: 90,8% на ComplexFuncBench Audio (многошаговый вызов функций с ограничениями) и 36,1% на Audio MultiChallenge от Scale AI (сложное выполнение инструкций с включённым «мышлением»)
- Улучшенные возможности: Лучшее понимание тональности, распознавание акустических нюансов, таких как высота тона и темп, а также динамическая адаптация к раздражению или замешательству пользователя
- Водяные знаки: Всё сгенерированное аудио включает водяной знак SynthID для обнаружения AI-контента
- Поддержка языков: Доступна в более чем 200 странах и территориях
Доступность
- Для разработчиков: Доступна в предварительной версии через Gemini Live API в Google AI Studio
- Для предприятий: Включена в Gemini Enterprise for Customer Experience
- Для обычных пользователей: Доступна через Search Live и Gemini Live
Модель позволяет создавать голосовые агенты, способные выполнять сложные задачи в шумной обстановке, и поддерживает более длинные цепочки диалогов при продолжительном взаимодействии.
📖 Read the full source: HN AI Agents
👀 Смотрите также

Искусственный интеллект-зомбификация университетов: из первых рук о читерстве с помощью LLM в элитных колледжах
Анализ того, как LLM систематически разрушают академическую честность в элитных университетах, с конкретными примерами из UChicago: разрыв в 40 баллов между домашними и аудиторными тестами, студенты фотографируют экзамены во время тестов, профессора пишут лекции с помощью ChatGPT.

Исследование ETH Zurich ставит под сомнение ценность файлов AGENTS.md для ИИ-агентов в программировании
Новое исследование ETH Zurich показывает, что файлы AGENTS.md, сгенерированные LLM, снижают успешность выполнения задач ИИ-агентами на 3% и увеличивают затраты на вывод более чем на 20%, в то время как файлы, написанные человеком, дают лишь незначительный прирост в 4% при аналогичном увеличении затрат.
Обыденный риск: почему самые большие угрозы ИИ-безопасности скучны, а не драматичны
В эссе утверждается, что банальные сбои ИИ уже наносят масштабный ущерб, современные подходы к выравниванию слишком сильно зависят от изолированных сред, а конвергенция возможностей делает случайное попадание в открытый мир все более вероятным.

Исследование: центры обработки данных ИИ повышают локальную температуру до 9,1°C
Исследование Кембриджского университета показало, что центры обработки данных ИИ повышают температуру поверхности земли в среднем на 2°C после начала эксплуатации, а в экстремальных случаях рост достигает 9,1°C, затрагивая территории на расстоянии до 10 километров.