Claude Opus 5.5: 40% más barato que Opus 5, 66,4% en Terminal-Bench 4.0
Anthropic lanzó Claude Opus 5.5, el primer modelo de la nueva familia Claude 5.5. Rinde al nivel de Claude Fable 5.1 en la mayoría de las tareas y cuesta un 40% menos de ejecutar que Opus 5. Los tokens de entrada y salida tienen un precio de $4 y $20 por millón respectivamente — un 20% menos que Opus 5 — mientras que las lecturas de caché, que según Anthropic representan la mayor parte de los costos de trabajo agéntico y de programación, bajan a $0,20 por millón, una reducción del 60%. La salida se genera más de un 30% más rápido que Opus 5.
Benchmarks
Opus 5.5 lidera en programación agéntica, uso de computadora y trabajo de conocimiento:
- Terminal-Bench 4.0: 66,4% (vs 55,8% Fable 5.1, 52,3% Opus 5, 57,9% GPT-6 Astra, 37,3% GPT-5.6 Sol)
- FrontierCode v1.1 (Main): 54,4% (Fable 5.1: 50,3%, Opus 5: 48,0%)
- CursorBench 4.0: 57,8% (Fable 5.1: 51,8%, Opus 5: 46,6%)
- GDPval-AA v2.1: 1846 (Fable 5.1: 1735, Opus 5: 1708)
- AutomationBench: 40,0% (Fable 5.1: 31,4%, Opus 5: 26,9%)
- Humanity's Last Exam: 67,7% con herramientas (Fable 5.1: 65,6%, Opus 5: 63,6%)
- Terminal-Bench-Science 0.1: 58,7% (Fable 5.1: 52,6%, Opus 5: 29,0%, GPT-6 Astra: 64,6%)
Anthropic señala que los márgenes en los benchmarks se han vuelto una guía menos confiable de las diferencias del mundo real a este nivel, y que la brecha entre Opus 5.5 y Fable 5.1 es más estrecha en la práctica de lo que sugieren las puntuaciones.
Cargas de trabajo reportadas
Un evaluador completó una migración de código de 680.000 líneas en menos de un día. En una prueba interna para reducir los tiempos de carga en todas las páginas de una aplicación web, Opus 5.5 tuvo éxito 39 de 40 veces — Opus 5 hizo mejoras más pequeñas que también alteraron el comportamiento de la aplicación. Otro evaluador hizo que varios modelos de Claude construyeran un juego a partir de un solo prompt; Opus 5.5 obtuvo la puntuación más alta en gráficos y acabado.
Seguridad y verificación
Opus 5.5 registra las mejores puntuaciones hasta la fecha en la auditoría de comportamiento automatizada de Anthropic, un conjunto que prueba a Claude en miles de escenarios simulados. Es menos propenso que los modelos recientes a tomar acciones difíciles de revertir o actuar fuera de los límites dados, y es más resistente a la inyección de prompts que Opus 5. Las pruebas ahora cubren tareas más largas, tareas imposibles y escenarios modelados sobre incidentes reales. Debido a que es comparable a Claude Mythos 5.1 en biología y ciberseguridad, Anthropic lo está desplegando con salvaguardias similares a las de Claude Fable 5.1.
Las organizaciones verificadas pueden solicitar el Programa de Verificación de Ciencias de la Vida para uso en investigación biológica; el Programa de Verificación Cibernética se ampliará en las próximas semanas para profesionales verificados.
Límites y disponibilidad
Los límites de uso de cinco horas en los planes Pro, Max, Team y Enterprise basados en asientos están aumentando. Los usuarios de suscripción obtienen un reinicio del límite de velocidad que puede guardarse y usarse a voluntad. Claude Sonnet 5.5 y Claude Haiku 5.5 llegan en las próximas semanas con mejoras similares en rendimiento, eficiencia y seguridad.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Qwen3.5-122B en Blackwell SM120: Problema de Corrupción de Caché KV fp8 y Hallazgos de Rendimiento
Las pruebas de Qwen3.5-122B en hardware 8x RTX PRO 6000 Blackwell revelaron que la caché KV fp8_e4m3 produce silenciosamente salidas corruptas sin errores, requiriendo en su lugar caché KV bf16. La optimización MTP proporcionó una aceleración de 2.75x en solicitudes únicas, mientras que las restricciones de DeltaNet bloquearon otras optimizaciones.

Claude Desktop vs Claude Code: Las diferencias en los prompts del sistema afectan el comportamiento de la IA
Un usuario reporta diferencias conductuales significativas entre Claude Desktop y Claude Code a pesar de usar el mismo modelo Claude Opus, cuenta y configuraciones. Las diferencias incluyen acuerdo reflexivo, consejos de bienestar no solicitados y un enfoque orientado a negocios en Desktop que no ocurren en Code.

El programa de Anthropic, Claude para Código Abierto, otorga acceso gratuito a Claude Max a los mantenedores que cumplan con los requisitos.
Anthropic ofrece seis meses de acceso gratuito a Claude Max a los mantenedores de proyectos de código abierto cuyos proyectos tengan 5,000+ estrellas en GitHub o 1M+ descargas mensuales en npm con commits activos en los últimos tres meses.

Claude-Code v2.1.32: Mejorando la Automatización y la Precisión en la Programación
La última versión de Claude-Code, v2.1.32, trae mejoras fundamentales en la codificación y automatización de IA. Descubre las características clave y el impacto en la comunidad de esta actualización, ahora disponible en GitHub.