Aprovechando la Señal de Agencia Oculta (Â) de los LLM para Mejorar la Llamada de Herramientas

Mientras depuraba fallos del agente ReAct con Qwen3, un desarrollador descubrió que los estados ocultos justo antes de las llamadas a herramientas son linealmente separables de los estados sin herramientas con AUC > 0.94. Esta dirección en el espacio latente, llamada  (por "agencia"), existe en todos los tamaños de modelo desde 1.7B hasta 8B y predice llamadas a herramientas usando solo una sonda lineal.
Cómo usar la señal de agencia
Durante la inferencia, proyecta cada estado oculto en Â. Si la proyección supera un umbral θ, el modelo quiere llamar a una herramienta incluso si no lo expresa textualmente. Luego puedes forzar una llamada a herramienta.
# En tiempo de inferencia (pseudocódigo)
hidden_state = get_middle_layer_state(model, input_text)
proj = np.dot(hidden_state, Â)
if proj > threshold:
# El modelo quiere actuar → forzar llamada a herramienta
tool = choose_tool() # puede aprenderse o ser heurístico
result = execute_tool(tool)
else:
# Generación normal
output = model.generate(input_text)
Resultados de rendimiento
Probado en 40 tareas diversas (búsqueda, código, archivos, comunicación, datos) con modelos Qwen3:
- Qwen3-1.7B: 26.7% → 85% (+58% de mejora)
- Qwen3-8B: 52.5% → 76.3% (+23% de mejora)
El modo de fallo "sin herramientas" bajó del 43% al 2.6%. Los modelos más pequeños se benefician más porque su decodificación textual es más débil, pero la señal geométrica es igualmente fuerte.
Cómo extraer Â
Tres métodos:
- Opción 1: Desde tus propios rastros - Calcula la diferencia media normalizada entre estados ocultos con herramienta y sin herramienta
- Opción 2: Mediante prompts contrastivos - Ejecuta 15 pares de prompts (uno que requiere una herramienta, otro pasivo) a través de tu modelo y toma la diferencia media en la capa media
- Opción 3: Usa direcciones precalculadas - Usa las direcciones  extraídas para modelos Qwen3 compartidas en el repositorio
Implementación empaquetada
El descubrimiento se ha empaquetado en una biblioteca para fácil reutilización:
bash
pip install a-hat-optimizer
python
from a_hat_optimizer import AHat
# Extracción automática desde cualquier modelo HF en 1 línea
ahat = AHat.from_model("Qwen/Qwen3-8B")
# O cargar preextraída
ahat = AHat.from_file("my_ahat_dir/")
# Usar en tu agente
should_call, confidence = ahat.predict(hidden_state)
if should_call:
print(f"Forzar llamada a herramienta (confianza: {confidence:.2f})")
La biblioteca maneja extracción automática mediante prompts contrastivos, 4 estrategias de calibración (punto medio, F1, Youden, percentil), predicción por lotes, y guardar/cargar con metadatos incluyendo AUC e información de capas.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

ClawMetry añade monitoreo remoto con cifrado de extremo a extremo para agentes OpenClaw.
ClawMetry v0.1.0 ahora incluye sincronización en la nube para el monitoreo remoto de agentes OpenClaw desde cualquier navegador o aplicación de la barra de menús de Mac, con cifrado de extremo a extremo que mantiene los datos encriptados hasta que llegan a tu cliente.

OpenClaw vs Hermes: Diferentes Filosofías de Diseño para Agentes de IA
OpenClaw es una puerta de enlace multicanal que conecta WhatsApp, Telegram, Discord, Slack e iMessage con un amplio ecosistema de habilidades, mientras que Hermes es un agente de aprendizaje que evalúa tareas, guarda patrones como habilidades reutilizables y construye un modelo de tu flujo de trabajo con el tiempo.

Interfaz de Usuario de Equipos de Agentes Claude: Aplicación de Escritorio para Visualizar Flujos de Trabajo de Agentes de Código Claude
Un desarrollador creó una aplicación de escritorio gratuita y de código abierto que agrega una capa visual a la función experimental de Equipos de Agentes de Claude Code. La aplicación proporciona un tablero kanban en tiempo real donde las tareas se mueven automáticamente mientras los agentes trabajan, además de comunicación entre equipos, flujos de revisión integrados y revisión de código por tarea.

Conduid: Capa de Infraestructura de Confianza para Servidores MCP Construidos con Claude
Conduid indexa más de 25,000 servidores MCP en GitHub, npm, PyPI y los principales directorios, asignando a cada uno una puntuación de 0 a 100 basada en la actividad de GitHub, la postura de seguridad, la calidad de la documentación y las señales de mantenimiento. Todo el código fue escrito con Claude por un fundador en solitario.