Feynman: Agente de Investigación de Código Abierto con Herramienta de Auditoría de Base de Código de Artículos

Qué hace Feynman
Feynman es un agente de investigación CLI de código abierto que maneja preguntas de investigación a través de una arquitectura multiagente. Cuando haces una pregunta de investigación, despacha cuatro subagentes en paralelo:
- Investigador: Busca artículos y en la web
- Revisor: Ejecuta una revisión por pares simulada con calificación de severidad
- Escritor: Produce resultados estructurados
- Verificador: Verifica cada cita y elimina enlaces rotos
Características clave de la fuente
La característica destacada mencionada en la fuente es la herramienta de auditoría: Feynman audit [arxiv-id] extrae las afirmaciones de un artículo y las compara con el repositorio de código público real. Esto aborda el problema común de preguntarse si el código publicado realmente implementa lo que se afirma en el artículo.
Otras capacidades incluyen:
- Replicación de experimentos en GPUs locales o en la nube a través de modal/runpod
- Revisiones de literatura que muestran consenso vs desacuerdos vs preguntas abiertas
- Modo de investigación profunda con investigación paralela multiagente
- Opción de instalar solo las habilidades de investigación en Claude Code o Codex sin la aplicación completa de terminal
Detalles técnicos
- Instalación de un solo comando
- Licencia MIT
- Construido sobre pi para el tiempo de ejecución del agente
- Utiliza alphaxiv para la búsqueda de artículos
- 2.3k estrellas en GitHub al momento de la publicación de la fuente
- El tweet de lanzamiento recibió 2,768 marcadores de una cuenta con 1,400 seguidores
La arquitectura aborda específicamente los problemas de alucinación comunes en las herramientas de investigación de IA dedicando un agente completo a detectar citas incorrectas antes de que lleguen al usuario.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Resultados de Referencia: 15 LLMs Evaluados en 38 Tareas de Flujo de Trabajo Real
Un desarrollador comparó 15 LLMs en la nube y locales en 38 tareas de su flujo de trabajo real, incluyendo transformaciones CSV, conteo de letras, aritmética modular y cumplimiento de formato. Claude 3.5 Sonnet y Opus obtuvieron ambos un 100%, pero Sonnet cuesta 3.5 veces menos por llamada.

Desarrollador Crea la Aplicación LibraHQ para Resolver el Problema de Memoria de Agentes de IA
Un desarrollador creó LibraHQ, una aplicación gratuita de notas que sirve como una capa de memoria compartida entre chatbots y agentes de programación. La aplicación registra notas y decisiones importantes de los chats y las almacena para sesiones futuras, abordando el problema de que los agentes de IA olviden decisiones previamente tomadas.

Consulta Tu Sprint de Jira Mediante Claude MCP: Estado Instantáneo, Incidencias Sin Asignar y Elementos Bloqueados
Un usuario de Reddit conectó Jira a Claude mediante MCP, luego hizo preguntas en lenguaje natural sobre su sprint y obtuvo tablas limpias al instante, sin tener que hacer clic en los tableros.

NerfGuard: Un clasificador que enruta solicitudes de codificación a modelos más baratos, reduciendo el gasto 3 veces
NerfGuard usa un clasificador rápido para enrutar las solicitudes del agente de codificación al modelo y nivel de razonamiento menos costosos, lo que permite un uso 3x con el mismo gasto. Incluye optimizaciones de tokens.