Охота на баги: Сбои WireGuard и несоответствие MTU в GKE

Инфраструктурная команда Lovable отлаживала сетевую проблему в кластере Google Kubernetes Engine (GKE), вызывавшую периодические сбои соединений. Используя AI-агента для сканирования логов Clickhouse, они обнаружили, что поды anetd (реализация Cilium от Google) падали ~120 раз на под за шесть дней — почти раз в час. Дампы крашей выявили панику конкурентного доступа к карте в коде интеграции WireGuard от Google, а не в самом WireGuard.
Первое исправление: отключение прозрачного шифрования
Поддержка Google рекомендовала отключить шифрование между узлами, чтобы обойти баг WireGuard. Команда применила изменение и перезапустила все поды anetd. Краши прекратились примерно на четыре часа — затем пользователи начали видеть случайные сбои соединений с Valkey (их хранилищем данных в памяти).
Вторая ошибка: несоответствие MTU
Инженер Эрик использовал tcpdump и Wireshark для захвата пакетов. Улика: "Destination unreachable (Fragmentation needed)". Вот причина:
- При включенном WireGuard MTU кластера был установлен на 1420 байт (с учетом накладных расходов WireGuard в 80 байт).
- После отключения WireGuard конфигурации должны были вернуться к стандартным 1500 байтам, но некоторые узлы не были перезапущены — они все еще использовали старый MTU 1420.
- Соединения Valkey, проходящие через узлы с несоответствующими MTU, периодически сбоили.
Решение
Исправление: rolling restart всех узлов для обеспечения согласованной конфигурации MTU по всему кластеру. Это устранило ошибки фрагментации и восстановило стабильность.
Основные выводы
- Первая ошибка была в интеграции WireGuard от Google в
anetd— баг конкурентности при доступе к карте. Она специфична для реализации GKE. - Отключение шифрования обошло панику, но вызвало несоответствие MTU, которое потребовало полного развертывания узлов.
- AI-агенты помогли быстро выявить паттерн крашей anetd из миллионов строк логов.
📖 Read the full source: HN AI Agents
👀 Смотрите также

Используйте планировщики задач для общих задач кодирования
Хэм Воке объясняет, как использовать простые bash-скрипты или Makefile в качестве планировщиков задач для стандартизации общих команд, таких как сборка, тестирование и форматирование, в разных репозиториях.

Запуск Qwen3.6 27B и 35B на 6 ГБ VRAM с ik_llama: практические конфигурации и бенчмарки
Пользователь делится подробными конфигами ik_llama и показателями производительности для запуска моделей Qwen3.6 27B и 35B A3B на RTX2060 mobile (6 ГБ VRAM, 32 ГБ ОЗУ) со скоростью префилла 40-100 т/с и генерацией до 11 т/с.

Как оптимизировать вашу настройку OpenClaw с конкретными инструкциями и улучшениями
Оптимизация OpenClaw основывается на точных инструкциях и непрерывной доработке личностей агентов и экономичном использовании модели.

Руководство по настройке OpenClaw на основе анализа Reddit: оборудование, стоимость, память и практики безопасности
Пользователь Reddit проанализировал типичные ошибки при внедрении OpenClaw и создал практическое руководство по настройке на основе отзывов сообщества. Руководство охватывает аппаратные требования, оптимизацию затрат до $10 в месяц, управление памятью с помощью файлов MEMORY.md и меры безопасности для предотвращения атак через инъекцию промптов.