100 000 «почему» ИИ: как квазидетерминированные выходные данные LLM создают узнаваемую халтуру

В недавнем посте в Substack lcamtuf (исследователь безопасности, известный по AFL и другим инструментам) затрагивает повторяющийся спор: можно ли отличить текст, написанный человеком, от вывода LLM. Его аргумент основан на конкретном наблюдении о том, как ведут себя современные модели на практике.
Основное утверждение: квазидетерминизм
LLM — это современные статистические модели человеческого языка. Теоретически их вывод должен быть неотличим от человеческого текста при любом статистическом тесте. Но lcamtuf утверждает, что реальная отличительная черта — это квазидетерминизм: дайте сотне «авторов» похожий запрос, например, «создай справочник для детей», и модель примерно в 80% случаев выдаст функционально идентичный результат.
Он иллюстрирует это коллажем из ~220 обложек книг Amazon по запросу «100000 почему» (ссылка). Изображение показывает группы почти идентичных обложек:
- Верхние два ряда — ревущий тираннозавр слева
- Повторяющиеся мотивы: красно-белая мультяшная ракета, золотистый ретривер, лев
- Имена авторов включают неправдоподобное количество «Брайтов»: Итан, Нолан, Памела, Дэниел, Томас, Эндрю В., Майан, Мэри, Леви — все Брайты
Почему это важно для разработчиков
Для команд, которые публикуют ИИ-сгенерированный контент или работают с LLM API, вывод в том, что нельзя полагаться на случайность для маскировки ИИ-происхождения. Статистическая сигнатура не в индивидуальном выборе слов — она в том, что модель возвращает одну и ту же структуру ответа высокого уровня на похожие запросы. Если ваш рабочий процесс включает генерацию множества вариаций похожих запросов, вывод будет группироваться, что делает его легко заметным.
lcamtuf отмечает: «Это нечеткий сигнал, так что не стоит увольнять стажера, когда он говорит „это не то — это другое“. Но в более неформальных ситуациях можно доверять своей интуиции».
Практический вывод
Если вы используете LLM для автоматизации блогов, имейте в виду, что ваш контент может в итоге выглядеть точно так же, как у всех остальных. P.S. в посте звучит прямо: «да, технология потрясающая, но, скорее всего, вашу публикацию можно переименовать в „100 000 почему“».
В посте также есть ссылки на примеры, выходящие за рамки этой книги (больше примеров), и отмечается, что оригинальная «Сто тысяч почему» — это советская детская книга 1929 года, популярная в Китае, что, вероятно, породило запрос.
📖 Читайте полный источник: HN LLM Tools
👀 Смотрите также

Приятель отказался от роли с оплатой $300k+ за замену 70% персонала агентами Claude — Reddit обсуждает моральную и техническую реальность
Пост на Reddit описывает друга, который отказался от должности «руководителя внедрения ИИ» для картирования рабочих процессов, создания конвейеров агентов Claude/GPT и увольнения 70% сотрудников. Автор поста утверждает, что зарплата в $300k+ стоит того, чтобы тратить время и наблюдать, как заблуждения топ-менеджмента терпят крах.
Stripe接近达成70亿美元交易,收购AI公司OpenRouter
По данным Bloomberg, Stripe близок к приобретению AI-стартапа OpenRouter более чем за 7 миллиардов долларов. Сделка знаменует значительную консолидацию в сфере AI-инфраструктуры.

Подсистема звука Linux наводнена исправлениями с ИИ: IRQ, UAF и особенности
В запросе на включение изменений для звуковой подсистемы Linux 7.1 Такаши Иваи отмечает множество патчей с пометкой 'assisted-by' от Claude Code и GPT-5.5, исправляющих обработку IRQ в HD-audio, ошибки UAF и проблемы с оборудованием Realtek/Intel.

Claude Code: Автоматический режим станет режимом разрешений по умолчанию 14 августа
Anthropic делает автоматический режим режимом разрешений по умолчанию в Claude Code для пользователей Pro, Max и Team с 14 августа. Классификатор в автоматическом режиме выявил 89% опасных команд в тестах, тогда как при ручном подтверждении — 14%.