Текущее состояние китайских больших языковых моделей: лидеры рынка, открытые модели и бизнес-модели

Это краткое изложение текущего состояния китайских LLM, основанное на исследовании, опубликованном на r/LocalLLaMA. Анализ классифицирует основных игроков по их проприетарным моделям, предложениям с открытыми весами и бизнес-подходам.
Крупные компании и их модели
ByteDance: Их проприетарная модель dola-seed (также называемая Doubao) описывается как нынешний лидер рынка, играющий роль, аналогичную OpenAI. У них также есть модель с открытым исходным кодом Seed OSS 36B, но, как отмечает источник, она не вызывает активного обсуждения.
Alibaba: Их проприетарная модель Qwen Max, по сообщениям, не получила широкого распространения. Однако Alibaba отмечается как сильнейшая в предложениях с открытыми весами, особенно небольших моделей, и лидирует в возможностях преобразования текста в изображение (T2I) и текста в видео (T2V).
Tencent: Их проприетарная модель Hunyuan также не получила широкого распространения. Их усилия в области T2I и T2V считаются вторыми после Alibaba.
Baidu: Их проприетарная модель Ernie не получила широкого распространения, при этом Baidu сильнее в области автономного вождения.
Xiaomi: Их проприетарная модель — Mimo V2 Pro, а модель с открытыми весами — Mimo V2 Flash 309B-A15B.
DeepSeek: Инновационный побочный проект
DeepSeek описывается как побочный проект компании, занимающейся алгоритмической торговлей. Текущее использование в Китае, по сообщениям, занимает близкое второе место после Doubao от ByteDance, с примерно половиной пользователей. Источник выделяет DeepSeek как «самую инновационную среди всех китайских компаний, работающих с LLM», которая изобрела такие методы, как MLA, MTP, DSA и GRPO. Анализ предполагает, что её бизнес-модель может быть похожа на модель «Шести AI-тигрят», но высказывает предположение, что проект, возможно, больше предназначен для привлечения инвестиций и получения политического доступа.
Шесть AI-тигрят
Эту группу характеризуют очень похожие бизнес-модели: выпуск больших моделей с открытыми весами для получения признания при одновременном предоставлении дешёвых услуг вывода (инференса). Источник ставит под сомнение их долгосрочную жизнеспособность.
- Zhipu: Провела IPO в Гонконге. Их текущая модель
GLM-5описывается как производная от DeepSeek. - Minimax: Провела IPO в Гонконге. У них есть проприетарная модель
MiniMax 2.7и модель с открытыми весамиMiniMax 2.5, которая описывается как «простая MoE 229B-A10B». Сообщается, что эта архитектура даёт им значительно более низкие затраты на инференс по сравнению с другими. - Moonshot: Их модель с открытыми весами
Kimiописывается как производная от DeepSeek. - Stepfun: Их модель с открытыми весами
Step 3.5 flashиспользует смесь слоёв полного внимания и скользящего оконного внимания (SWA) в соотношении 1:3. Она описывается как модель 196B-A11B с бизнес-моделью, похожей на Minimax, хотя, по сообщениям, их модель не так хороша. - Baichuan: Их модель
Baichuan-M3 235Bописывается как медицински улучшенная модель с открытыми весами, основанная наQwen3Moe. - 01 AI: Их последней моделью с открытыми весами была
Yi-34B, опубликованная в ноябре 2024 года. Теперь они, как сообщается, сосредоточены на корпоративных системах AI-агентов, что делает их «неактуальными для людей здесь».
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Claude Code v2.1.178 добавляет правила разрешений Tool(param:value), исправляет проблемы Subagent и Auth
Claude Code v2.1.178 добавляет синтаксис Tool(param:value) для правил разрешений, исправляет просмотр транскриптов саб-агентов, несоответствия токенов OAuth и кэширование аутентификации.

Еженедельный обзор мультимодального ИИ: Holotron-12B, Nemotron Omni, GlyphPrinter и другие
В этой неделе среди основных достижений в области мультимодального ИИ можно выделить Holotron-12B для задач компьютерного использования, модели NVIDIA Nemotron Omni, объединяющие язык, зрение и голос, GlyphPrinter для точного рендеринга текста при генерации изображений, а также несколько проектов с открытым исходным кодом для улучшения видео, 3D-сегментации и многоагентных систем.

По умолчанию VS Code включит анонс Co-Authored-by Copilot
PR #310226 от Microsoft VS Code изменяет значение по умолчанию для настройки git.addAICoAuthor с 'off' на 'all', автоматически добавляя заголовок Co-authored-by для AI-генерируемых вкладов. PR также обнаруживает несоответствие резервного варианта во время выполнения в repository.ts.

Сравнение бенчмарков Qwen3.6 Plus с западными моделями SOTA
Qwen3.6 Plus набирает 78,8 баллов в SWE-bench Verified, 90,4 в GPQA/GPQA Diamond, 28,8 в HLE (без инструментов) и 78,8 в MMMU-Pro, что делает его конкурентоспособным по сравнению с такими моделями, как GPT-5.4, Claude Opus 4.6 и Gemini 3.1 Pro Preview.