GLM 5 en Mac M3: Observaciones de Rendimiento para Codificación Agéntica

✍️ OpenClawRadar📅 Publicado: 23 de febrero de 2026🔗 Source
GLM 5 en Mac M3: Observaciones de Rendimiento para Codificación Agéntica
Ad

Puntos de Referencia de Rendimiento y Limitaciones

Un desarrollador probó GLM 5 utilizando cuantización de 4 bits de MLX en un Mac M3 con 512 GB de RAM para tareas de programación agéntica. Se describe el modelo como "bastante utilizable" cuando el contexto se mantiene por debajo de aproximadamente 50,000 tokens, aunque significativamente más lento que soluciones basadas en API como Claude, particularmente durante el procesamiento de prompts.

El rendimiento se degrada sustancialmente cuando el contexto supera los 50k tokens. En una prueba procesando 65k tokens, la primera mitad se completó en 8 minutos (67 tokens/segundo), mientras que la segunda mitad tomó 18 minutos adicionales, resultando en una tasa general de 41 tokens/segundo. La generación de tokens sigue siendo más rápida, estimada en 12-20 tokens/segundo en tamaños de contexto grandes.

Observaciones del Flujo de Trabajo

El usuario señala que Opencode (el sistema de programación agéntica) maneja la generación de código en múltiples archivos de manera eficiente una vez que se crea un plan, produciendo "miles de tokens de código a través de múltiples archivos en solo unos minutos con razonamiento intermedio". El procesamiento de prompts típicamente toma "un par de minutos" para leer unos cientos de líneas de código por archivo, con un total de unos 10 minutos distribuidos entre sesiones de planificación.

La compactación en Opencode "sí toma un tiempo, ya que básicamente le gusta reprocesar todo el contexto". Con un límite de contexto de 50k tokens, la compactación toma aproximadamente 5 minutos.

Ad

Configuración Técnica y Expectativas Futuras

La prueba se realizó utilizando LM Studio, que puede no proporcionar las últimas optimizaciones de tiempo de ejecución. El usuario sugiere que "MLX o incluso GGUF podrían obtener un procesamiento de prompts más rápido a medida que se actualicen los tiempos de ejecución para GLM 5, pero probablemente no será MUCHO más rápido que esto".

No se recomienda esta configuración para tareas que requieran 70k+ tokens en contexto, debido tanto a las limitaciones de tamaño de contexto como a la "lentitud insoportable" que ocurre después de superar ciertos umbrales durante el procesamiento de prompts.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Integración de OpenClaw para los Mercados Bursátiles Indios: Terminal de Análisis y Negociación Multiagente
Herramientas

Integración de OpenClaw para los Mercados Bursátiles Indios: Terminal de Análisis y Negociación Multiagente

Una terminal de trading de código abierto para los mercados indios se ha conectado como un servidor de habilidades de OpenClaw, permitiendo que cualquier agente de OpenClaw obtenga datos del mercado de valores indio y ejecute análisis completos a través de HTTP sin instalación local. El sistema utiliza siete agentes especialistas trabajando en paralelo para generar análisis estructurado con planes de trading.

OpenClawRadar
Sistema de Memoria Automática de Código Abierto para Agentes LLM Logra un 94% de Precisión en Recuperación
Herramientas

Sistema de Memoria Automática de Código Abierto para Agentes LLM Logra un 94% de Precisión en Recuperación

Un desarrollador creó un complemento de memoria para agentes basados en LLM que extrae, clasifica y persiste automáticamente hechos entre sesiones sin comandos explícitos del usuario. El sistema logró un 94.2% de precisión en una prueba de memoria de 52 puntos de control utilizando archivos markdown estructurados en lugar de bases de datos vectoriales.

OpenClawRadar
🦀
Herramientas

AIttache: Un servidor MCP de solo lectura que no puede destruir tu producción

AItache es un servidor MCP con más de 25 conectores de solo lectura (terminal, servidores, clima, Steam) que físicamente no puede modificar nada, diseñado para dar contexto de logs a los LLMs sin autonomía.

OpenClawRadar
Enrutar el tráfico de la API de Claude para controlar costos tras el cambio de suscripción Max
Herramientas

Enrutar el tráfico de la API de Claude para controlar costos tras el cambio de suscripción Max

La suscripción Max de Anthropic ya no cubre el uso de herramientas de terceros, obligando a los usuarios de OpenClaw a la facturación por API. Un proxy de enrutamiento dirige tareas simples a Claude Sonnet ($3/M entrada, $15/M salida) y las complejas a Opus ($5/M entrada, $25/M salida), reduciendo costos sin pérdida de calidad.

OpenClawRadar