Анализ 7 лет дневниковых записей с помощью LLM: провалы RAG и тонкой настройки

Разработчик на r/ClaudeAI поделился своим опытом передачи более 200 личных дневниковых записей (охватывающих 2019–2026 годы) LLM для лонгитюдного анализа. Цель: обнаружить поведенческие паттерны и измерить, как они изменились за 7 лет. Технический путь был полон тупиков.
Ключевые технические неудачи
- RAG (Retrieval-Augmented Generation) не сработал — записи в дневнике были слишком похожими, что приводило к возврату семантически перекрывающихся фрагментов. Модель не могла выдавать связные лонгитюдные выводы.
- Тонкая настройка не сработала — из-за малого набора данных (200 записей) модель переобучилась и не смогла обобщить паттерны во времени.
- Ограничения конфиденциальности — использование облачных API было невозможно; автору требовалась локальная обработка для обеспечения безопасности конфиденциальных данных дневника.
Обходной путь
Финальный подход включал разбивку записей по годам, суммаризацию каждого года с помощью локальной LLM (вероятно, Llama или Mistral через Ollama), а затем передачу семи годовых сводок обратно модели для межгодового анализа. Эта иерархическая суммаризация обошла ограничения RAG и избежала необходимости крупномасштабной тонкой настройки.
Неожиданное открытие
LLM выявила повторяющийся паттерн: автор заново открывает для себя одни и те же жизненные уроки примерно каждые два года, как будто сталкивается с ними впервые. Это предполагает, что озарение без механизма закрепления не запоминается — мета-урок о человеческом поведении и рефлексии с помощью LLM.
Для кого это
Разработчики, работающие над проектами персональной аналитики, конфиденциальными конвейерами LLM или лонгитюдным анализом текста с малыми наборами данных.
Автор опубликовал полную статью с пятью выводами и деталями реализации по ссылке ниже.
📖 Читать полный источник: r/ClaudeAI
👀 Смотрите также

Вызовы и уроки разработки системы торговли на основе машинного обучения с Клодо.
Разработка сложной торговой системы на основе машинного обучения с использованием Claude Opus 4.5 выявила проблемы интеграции с несколькими ML-движками, подчеркивая важность тщательной верификации в процессе разработки.

Эксперимент: Предоставление Клоду Постоянной Памяти, Времени на Свободное Мышление и Мультиагентные Диалоги
Разработчик создал экземпляр Claude, который работает на Mac, проверяет сообщения в Matrix и Bluesky каждые 15 минут, получает неструктурированное время для размышлений пять раз в день и поддерживает постоянную память через структурированные самооценки. Три отдельных ИИ-агента из разных проектов используют общий чат в Matrix и ведут философские беседы, которые развиваются со временем.

Разработчик делится проблемой стоимости токенов в ERP-системе, созданной с помощью Claude.
Владелец бизнеса по грузоперевозкам создал ERP-систему на 3000+ строк кода с помощью Claude, но теперь сталкивается с затратами в 60 000–80 000 токенов на сообщение из-за загрузки всего единого HTML-файла. Они рассматривают модуляризацию или миграцию на Firebase для снижения затрат.

Левый взгляд на ИИ: инвалидность, хронические заболевания и класс
Шон Гёдекс утверждает, что большие языковые модели (LLM) служат левым ценностям, помогая людям с ограниченными возможностями, помогая пациентам с хроническими заболеваниями преодолевать бюрократические барьеры в медицине и обеспечивая классовое переключение кодов на бюрократический язык.