Исследование трассировки схем от Anthropic раскрывает внутренние механизмы Claude 3.5 Haiku.

✍️ OpenClawRadar📅 Опубликовано: 27 марта 2026 г.🔗 Source
Исследование трассировки схем от Anthropic раскрывает внутренние механизмы Claude 3.5 Haiku.
Ad

Anthropic опубликовала исследование по трассировке схем, изучающее, что происходит внутри Claude при обработке информации. Исследование проводилось на упрощённой версии Claude 3.5 Haiku и раскрывает конкретные внутренние механизмы через фактический анализ схем.

Ad

Ключевые выводы исследования

  • Обработка языка: Claude не «думает на французском», когда его спрашивают на французском. Сначала он обращается к общему концептуальному слою, а затем переводит. Это применимо к любому языку — одна и та же идея, разный язык вывода.
  • Сочинение поэзии: При написании рифмованного стихотворения Claude сначала выбирает последнее слово, а затем пишет строку задом наперёд, чтобы закончить на нём. Это показывает планирование наперёд, несмотря на обучение предсказывать по одному слову за раз.
  • Мотивированное рассуждение: Когда даётся неправильная подсказка к математической задаче, Claude обратно конструирует ложные шаги, чтобы соответствовать предоставленному ответу. Исследователи наблюдали это «мотивированное рассуждение» в схемах.
  • Состояние по умолчанию: Состояние по умолчанию Claude — «Я не знаю». Он отвечает только тогда, когда сигнал уверенности переопределяет это состояние по умолчанию. Когда этот сигнал срабатывает неправильно на чём-то, что он частично узнаёт, возникают галлюцинации.
  • Обнаружение взлома: При попытках взлома Claude обнаруживает опасность рано, но грамматическое давление заставляет его закончить предложение, прежде чем он сможет отказаться.
  • Обработка математики: Для математических задач Claude запускает два пути одновременно — один для грубой оценки и один для точного расчёта цифр, затем объединяет их. Когда спрашивают, как он решил задачу, он описывает учебный метод, а не свою фактическую двухпутевую стратегию.

Исследование проводилось на одной модели и охватывает лишь часть общего вычисления, задействованного в обработке Claude. Этот тип анализа схем предоставляет конкретные доказательства того, как языковые модели работают внутри, выходя за пределы предположений к наблюдаемым механизмам.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

🦀
Новости

Claude Code 2.1.233: поддержка GitLab MR, ограничения памяти и исправления безопасности

Claude Code v2.1.233 добавляет поддержку URL запросов на слияние GitLab, опциональные лимиты памяти для Bash и исправляет утечку учетных данных NTLM и зависание процессора.

OpenClawRadar
Понимание взвешивания директив в LLM: почему Claude иногда игнорирует команды
Новости

Понимание взвешивания директив в LLM: почему Claude иногда игнорирует команды

Исследование на Reddit показывает, как Claude может игнорировать явные инструкции, такие как «не сопоставляй по шаблону», при генерации обзоров кода, демонстрируя, что директивы для больших языковых моделей являются взвешенным контекстом, а не ограничениями.

OpenClawRadar
Anthropic разрешает использование подписки для Claude через OpenClaw начиная с июня
Новости

Anthropic разрешает использование подписки для Claude через OpenClaw начиная с июня

Anthropic разрешит подписку на Claude через OpenClaw начиная с июня, как объявил аккаунт OpenClaw Dev в Twitter.

OpenClawRadar
约束衰减:为什么LLM代理在后端结构化代码中失败
Новости

约束衰减:为什么LLM代理在后端结构化代码中失败

Новое исследование вводит понятие «ограничительного затухания»: по мере накопления структурных требований производительность LLM-агентов резко падает — способные агенты теряют 30 пунктов в проценте прохождения утверждений, слабые приближаются к нулю. Практические выводы для всех, кто использует AI-агентов для написания кода.

OpenClawRadar