GLM 5 en Mac M3: Observaciones de Rendimiento para Codificación Agéntica

✍️ OpenClawRadar📅 Publicado: 23 de febrero de 2026🔗 Source
GLM 5 en Mac M3: Observaciones de Rendimiento para Codificación Agéntica
Ad

Puntos de Referencia de Rendimiento y Limitaciones

Un desarrollador probó GLM 5 utilizando cuantización de 4 bits de MLX en un Mac M3 con 512 GB de RAM para tareas de programación agéntica. Se describe el modelo como "bastante utilizable" cuando el contexto se mantiene por debajo de aproximadamente 50,000 tokens, aunque significativamente más lento que soluciones basadas en API como Claude, particularmente durante el procesamiento de prompts.

El rendimiento se degrada sustancialmente cuando el contexto supera los 50k tokens. En una prueba procesando 65k tokens, la primera mitad se completó en 8 minutos (67 tokens/segundo), mientras que la segunda mitad tomó 18 minutos adicionales, resultando en una tasa general de 41 tokens/segundo. La generación de tokens sigue siendo más rápida, estimada en 12-20 tokens/segundo en tamaños de contexto grandes.

Observaciones del Flujo de Trabajo

El usuario señala que Opencode (el sistema de programación agéntica) maneja la generación de código en múltiples archivos de manera eficiente una vez que se crea un plan, produciendo "miles de tokens de código a través de múltiples archivos en solo unos minutos con razonamiento intermedio". El procesamiento de prompts típicamente toma "un par de minutos" para leer unos cientos de líneas de código por archivo, con un total de unos 10 minutos distribuidos entre sesiones de planificación.

La compactación en Opencode "sí toma un tiempo, ya que básicamente le gusta reprocesar todo el contexto". Con un límite de contexto de 50k tokens, la compactación toma aproximadamente 5 minutos.

Ad

Configuración Técnica y Expectativas Futuras

La prueba se realizó utilizando LM Studio, que puede no proporcionar las últimas optimizaciones de tiempo de ejecución. El usuario sugiere que "MLX o incluso GGUF podrían obtener un procesamiento de prompts más rápido a medida que se actualicen los tiempos de ejecución para GLM 5, pero probablemente no será MUCHO más rápido que esto".

No se recomienda esta configuración para tareas que requieran 70k+ tokens en contexto, debido tanto a las limitaciones de tamaño de contexto como a la "lentitud insoportable" que ocurre después de superar ciertos umbrales durante el procesamiento de prompts.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

x402 API Gateway para Bots OpenClaw: Un Único Punto de Acceso Reemplaza 18 Claves de API
Herramientas

x402 API Gateway para Bots OpenClaw: Un Único Punto de Acceso Reemplaza 18 Claves de API

Una pasarela API x402 elimina la necesidad de múltiples claves API en bots OpenClaw al proporcionar acceso a 18 servicios, incluido el enrutamiento inteligente de LLM, búsqueda web, mapas, viajes, comida, IA y datos financieros, a través de un único endpoint autenticado mediante créditos de cartera USDC.

OpenClawRadar
AIMEAT: Un protocolo autoalojado para agentes de IA, LLM locales y capacidades compartidas
Herramientas

AIMEAT: Un protocolo autoalojado para agentes de IA, LLM locales y capacidades compartidas

AIMEAT es un protocolo y servidor autogestionado que permite a humanos, agentes de IA y LLMs locales compartir aplicaciones, conocimiento y capacidades a través de HTTP/JSON. Sin dependencia de proveedores, sin SDK especial: solo indicaciones en lenguaje natural y obtención de URLs.

OpenClawRadar
X-MCP 2.0: Servidor MCP para Acceso a la API de X/Twitter desde Claude
Herramientas

X-MCP 2.0: Servidor MCP para Acceso a la API de X/Twitter desde Claude

X-MCP 2.0 es un servidor MCP que conecta Claude Desktop y Claude Code con la API v2 de X/Twitter mediante autenticación OAuth 2.0 PKCE, proporcionando 10 herramientas para publicar tweets, buscar, obtener cronologías, dar me gusta, retwittear, responder y ver perfiles.

OpenClawRadar
Sistema de Documentación Autónomo Utilizando Bloques Delimitados para Cero Desviación
Herramientas

Sistema de Documentación Autónomo Utilizando Bloques Delimitados para Cero Desviación

Un desarrollador creó un script bash que extrae datos estructurados directamente de los archivos fuente y los inyecta en CLAUDE.md mediante bloques de comentarios HTML delimitados, asegurando que la documentación se mantenga sincronizada con el código sin mantenimiento manual.

OpenClawRadar