Explorando el Paso 3.5 Flash: Modelo de Código Abierto para Razonamiento Profundo Rápido

El Paso 3.5 Flash es un modelo de base de código abierto enfocado en ofrecer capacidades de razonamiento profundo rápidas y confiables. Utiliza una arquitectura de Mezcla de Expertos (MoE) dispersa, activando solo 11 mil millones de sus 196 mil millones de parámetros por token. Esta activación selectiva le otorga una alta "densidad de inteligencia", permitiéndole competir con los principales modelos propietarios mientras permanece ágil para interacciones en tiempo real.
Razonamiento Profundo y Velocidad
El modelo incorpora Predicción Multi-Token de 3 vías (MTP-3), lo que le permite procesar de 100 a 300 tokens por segundo, alcanzando un máximo de 350 en tareas de codificación de flujo único—ideal para razonamientos complejos y de varios pasos con una rápida capacidad de respuesta.
Rendimiento en Tareas de Codificación y Agentes
El Paso 3.5 Flash se destaca en tareas agénticas, respaldado por un marco de aprendizaje por refuerzo escalable que asegura una mejora continua. Alcanzó una puntuación del 74.4% en el benchmark verificado SWE-bench y del 51.0% en el Terminal-Bench 2.0, reflejando su capacidad para manejar tareas sofisticadas a largo plazo.
Procesamiento Eficiente de Contextos Largos
Soporta una amplia ventana de contexto de 256K utilizando una proporción de Atención de Ventana Deslizante (SWA) de 3:1, integrando tres capas de SWA para cada capa de atención completa. Este método reduce significativamente la sobrecarga computacional en comparación con los modelos tradicionales de contexto largo.
Despliegue Local y Accesibilidad
Diseñado para un fácil despliegue local, el Paso 3.5 Flash puede ejecutarse de forma segura en hardware de consumo de alta gama, como Mac Studio M4 Max y NVIDIA DGX Spark, asegurando la privacidad de los datos sin comprometer el rendimiento.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Decaimiento de Restricciones: Por qué los Agentes LLM Fallan en Código de Backend Estructurado
Una nueva investigación introduce la 'degradación por restricciones': a medida que se acumulan los requisitos estructurales, el rendimiento de los agentes LLM cae drásticamente — los agentes capaces pierden 30 puntos en tasas de aprobación de aserciones, los más débiles se acercan a cero. Perspectivas prácticas para cualquier persona que use agentes de IA para codificación.

Claude Code v2.1.211: Reenvío de texto de subagente, correcciones de permisos y cambios en el modo Vim
Claude Code v2.1.211 añade la opción --forward-subagent-text, corrige la suplantación de la vista previa de permisos, mejora las anulaciones de modelo de subagentes y actualiza s/S de Vim para que funcionen en modo NORMAL.

Análisis de Problemas de Evaluación Comparativa de TB2 en la Tarea de Recuperación de WAL de la Base de Datos
Un análisis de Reddit revela problemas con la tarea db-wal-recovery de Terminal Bench 2.0, donde los agentes pueden destruir accidentalmente evidencia al abrir bases de datos SQLite, y muestra cómo la inyección de prompts afecta los resultados del ranking.

La zombificación de las universidades por la IA: un relato en primera persona del engaño con LLM en colegios de élite
Un análisis de cómo los LLM están destruyendo sistemáticamente la integridad académica en universidades de élite, con ejemplos específicos de UChicago: brechas de 40 puntos entre exámenes para llevar a casa y presenciales, estudiantes fotografiando exámenes durante las pruebas y profesores redactando clases con ChatGPT.