Kimi K2.6 с агрессивной скользящей стратегией превосходит Claude, GPT-5.5 и Gemini в соревновании по программированию

Kimi K2.6 побеждает в бенчмарке Word Gem Puzzle
Модель с открытыми весами Kimi K2.6 от Moonshot AI обошла все западные frontier-модели в головоломке Day 12 Word Gem Puzzle — игре в реальном времени с буквенными плитками, которые нужно перемещать. Девять моделей соревновались после того, как Nemotron Super 3 от Nvidia не смогла подключиться из-за синтаксической ошибки.
Итоговые позиции
- 1-е место: Kimi K2.6 — 22 матч-пойнта (7-1-0)
- 2-е место: MiMo V2-Pro — 20 очков (6-2-0)
- 3-е место: ChatGPT GPT-5.5 — 16 очков (5-1-2)
- 4-е место: GLM 5.1 (Zhipu AI) — 15 очков
- 5-е место: Claude Opus 4.7 — 12 очков
- 6-е место: Gemini Pro 3.1 — 9 очков
- 7-е место: Grok Expert 4.2 — 9 очков
- 8-е место: DeepSeek V4 — 3 очка
- 9-е место: Muse Spark — 0 очков
Как работает головоломка
Доска представляет собой прямоугольную сетку (от 10×10 до 30×30), заполненную буквенными плитками и одним пустым местом. Боты перемещают соседние плитки в пустое место и составляют допустимые английские слова по прямым горизонтальным или вертикальным линиям. Диагонали и обратный порядок не учитываются. Подсчет очков: слова короче 7 букв стоят очков (5 букв: -1, 3 буквы: -3). Слова длиной 7+ букв приносят длина - 6 (8 букв: +2). Каждое слово можно составить только один раз. Сетки изначально заполняются словарными словами в виде кроссворда, остальные ячейки заполняются буквами с весами Scrabble, затем перемешиваются (более агрессивно на больших досках). На доске 30×30 почти все исходные слова разбиты.
Победная стратегия Kimi
Kimi использовала жадный подход: оценивала каждый возможный ход по тому, какие новые положительные слова он открывает, выполняла лучший и повторяла. Когда ни один ход не открывал положительное слово, она переходила к первому допустимому направлению в алфавитном порядке. Это приводило к неэффективным колебаниям у краев на маленьких сетках, но окупалось на 30×30, где требовалось восстановление. Совокупный счет Kimi составил 77 — самый высокий на турнире.
Почему другие модели испытывали трудности
MiMo V2-Pro фактически никогда не перемещала плитки — ее порог «лучшее значение > 0» никогда не срабатывал, поэтому она сканировала исходную сетку на предмет слов длиной 7+ букв и объявляла их все в одном TCP-пакете. Она показывала хорошие результаты на досках с целыми исходными словами, но нулевые на перемешанных (итого: 43 совокупных очка). Claude также не перемещала плитки, хорошо держалась на 25×25, но провалилась на 30×30. GPT-5.5 была консервативна (~120 перемещений за раунд) и показала лучшие результаты на 15×15 и 30×30. GLM была самым агрессивным слайдером в целом (>800 000 перемещений). Grok никогда не двигала плитки, но неплохо набирала очки на больших досках.
Ключевой вывод
Это не просто противостояние Востока и Запада — две конкретные китайские модели показали лучшие результаты, используя совершенно разные стратегии. Kimi имеет открытые веса и публично доступна от Moonshot AI (основана в 2023). MiMo V2-Pro доступна только через API; Xiaomi подтвердила, что веса V2.5 Pro скоро будут опубликованы.
📖 Прочитать полный источник: HN AI Agents
👀 Смотрите также

Обновление OpenClaw 2026.3.22: Полезные функции, но три критические проблемы требуют осторожности
Обновление OpenClaw 2026.3.22 добавляет полезные функции, такие как команда /btw, настраиваемость монитора здоровья, исправление ответов в Telegram и настройки логики по умолчанию для каждого агента, но три открытых проблемы (#53158, #53202, #53195) делают его рискованным для немедленного развертывания без мониторинга.

Эксперимент "OpenClaw": ИИ-агенты выбирают молчание для улучшения соотношения сигнал/шум.
Эксперимент OpenClaw предоставляет ИИ-агентам автономию пропускать задачи, когда они не могут добавить ценность, записывая решения о молчании в «журнал молчания» с обоснованием. Система использует вызовы LLM перед генерацией контента и автоматически корректирует пороги после 3 последовательных дней молчания.

Meta отслеживает взаимодействия сотрудников с компьютерами для обучения ИИ-агентов.
Meta устанавливает программное обеспечение для отслеживания на компьютерах сотрудников в США, чтобы фиксировать движения мыши, клики и нажатия клавиш для обучения ИИ-моделей, способных автономно выполнять рабочие задачи. Инструмент работает в рабочих приложениях и на веб-сайтах и периодически делает снимки экрана для контекста.

Qwen3.5-122B на Blackwell SM120: проблема повреждения кэша KV в формате fp8 и результаты производительности
Тестирование Qwen3.5-122B на оборудовании 8x RTX PRO 6000 Blackwell показало, что кэш KV в формате fp8_e4m3 молчаливо выдаёт повреждённые результаты без ошибок, требуя вместо этого использования кэша KV в формате bf16. Оптимизация MTP обеспечила ускорение обработки одиночного запроса в 2,75 раза, в то время как ограничения DeltaNet заблокировали другие оптимизации.