Gemini 3.1 Flash Live: Новая аудиомодель Google с улучшенными показателями и водяными знаками

Что нового в Gemini 3.1 Flash Live
Google выпустила Gemini 3.1 Flash Live — свою самую качественную аудио- и голосовую модель, предназначенную для диалогов в реальном времени. Модель обеспечивает повышенную скорость и естественный ритм для голосовых AI-приложений.
Ключевые технические детали
- Результаты тестов: 90,8% на ComplexFuncBench Audio (многошаговый вызов функций с ограничениями) и 36,1% на Audio MultiChallenge от Scale AI (сложное выполнение инструкций с включённым «мышлением»)
- Улучшенные возможности: Лучшее понимание тональности, распознавание акустических нюансов, таких как высота тона и темп, а также динамическая адаптация к раздражению или замешательству пользователя
- Водяные знаки: Всё сгенерированное аудио включает водяной знак SynthID для обнаружения AI-контента
- Поддержка языков: Доступна в более чем 200 странах и территориях
Доступность
- Для разработчиков: Доступна в предварительной версии через Gemini Live API в Google AI Studio
- Для предприятий: Включена в Gemini Enterprise for Customer Experience
- Для обычных пользователей: Доступна через Search Live и Gemini Live
Модель позволяет создавать голосовые агенты, способные выполнять сложные задачи в шумной обстановке, и поддерживает более длинные цепочки диалогов при продолжительном взаимодействии.
📖 Read the full source: HN AI Agents
👀 Смотрите также

Определение ИИ-агентов: Тест на работоспособность
Обсуждение на Reddit ставит под сомнение, являются ли многие продукты с ИИ-агентами по сути чат-ботами со списком задач, предлагая тест, основанный на их способности выполнять рабочие процессы в нескольких инструментах без ручного вмешательства.

Claude-Code версии 2.1.110 добавляет режим TUI, push-уведомления и множество исправлений.
Claude-Code v2.1.110 представляет новую команду /tui для рендеринга без мерцания, возможности push-уведомлений для мобильных оповещений, а также улучшения в управлении плагинами и функциональности удаленного управления. Выпуск также включает множество исправлений ошибок для MCP-серверов, обработки сессий и проблем с интерфейсом.

Снижение соответствия системному промпту Claude в длинных беседах
Агенты на основе Claude демонстрируют снижение соблюдения системных промптов после 40-50 сообщений, игнорируя правила форматирования и забывая ограничения. Проблема возникает из-за конкуренции системных промптов с историей диалога за внимание в контекстном окне.

Навыки Клода не имеют бизнес-модели для создателей — дилемма разработчика
Пользователь Reddit отмечает, что создатели навыков Claude не могут монетизировать свою работу, поскольку Anthropic выпустила отличную среду выполнения, но не создала экономику для разработчиков. Создатели остаются с проектами с открытым исходным кодом без возможности устойчивого развития.