Generación de código determinista vs probabilística: Por qué la conversión a Rust con Vibe-Coded de Bun genera señales de alerta

Noah Hall, escribiendo para The Tech Enabler, traza una línea clara entre la generación de código determinista y la probabilística. Utiliza la reciente conversión vibe-coded de Bun de un millón de líneas de Zig a Rust como advertencia. Su argumento central: los sistemas deterministas producen resultados consistentes y revisables; los LLM introducen incertidumbre que imposibilita la revisión de código a escala.
Generación de código determinista
Hall señala herramientas deterministas establecidas: el 2to3 de Python para la migración de Python 2 a 3, y transpiladores para lenguajes como Elm, PureScript y TypeScript que siempre producen el mismo JavaScript. Su propio lenguaje Derw puede generar JavaScript, TypeScript o inglés; Tegan genera JavaScript o Go; Mojie apunta a JavaScript, Python o inglés. Todos se basan en transformaciones AST a AST: con la misma entrada, siempre se obtiene la misma salida. La consistencia importa: "Si un error es consistente, podemos corregirlo. Si es inconsistente, se vuelve exponencialmente más difícil de corregir."
Generación de código probabilística
Los LLM varían la salida en cada ejecución: a veces A, a veces B. Hall creó neuro-lingo hace tres años como parodia: los humanos solo escriben firmas de funciones y comentarios, y los LLM generan la implementación nueva en cada compilación. Un ejemplo:
function add(a: number, b: number): number {
// Suma dos números
}
function main() {
// Imprime "Hello World" en la consola
// Imprime el resultado de add(2, 3)
}"Cada vez que neuro-lingo se compila, el código se genera desde cero por los LLM. Es ligeramente diferente cada vez. A veces introduce errores. A veces es limpio y simple. A veces es caótico." Hall argumenta que los flujos de código completamente impulsados por IA hacen exactamente esto, pero se envían a producción con responsabilidad humana.
La falacia de "hay pruebas"
Las pruebas por sí solas no pueden garantizar la calidad. Hall cita a SQLite como el código base más probado: 155.8 KSLOC de código C frente a 92,053.1 KSLOC de código de prueba (590 veces más). A pesar de una cobertura de ramas del 100%, millones de casos de prueba y extensos harness, SQLite aún depende de la revisión humana. "No es posible que un humano revise 1 millón de líneas de cambios en 9 días. Bun no ha revisado el código que fusionaron en master."
Hall concluye que la generación de código determinista aún necesita validación, y la generación probabilística crea un riesgo que escala con el número de líneas. El artículo fuente profundiza en cada ejemplo.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Claude.ai, la API y Claude Code están experimentando un aumento de errores
Claude.ai, la API de Claude y Claude Code están experimentando errores elevados con la interfaz web y la consola de desarrolladores caídas. El inicio de sesión de Claude Code a través de Claude.ai está roto, aunque los usuarios que ya han iniciado sesión aún pueden usarlo.

Los Autoencoders de Lenguaje Natural de Anthropic convierten las activaciones de Claude en inglés legible — Así es como
Anthropic presenta los Autoencoders de Lenguaje Natural (NLAs) que convierten las activaciones internas de Claude en explicaciones en texto plano, revelando el razonamiento del modelo sobre rimas, conciencia de pruebas de seguridad y detección de trampas.

'Lavado de IA': Empresas del Reino Unido se reinventan como compañías de IA pese a vínculos débiles
Ejecutivos de relaciones públicas informan que empresas del Reino Unido les obligan a presentar automatización ordinaria como IA, y el 50% de los comunicados de prensa relacionados con IA se envían bajo coacción. Ejemplos incluyen un giro de AllBirds hacia la adquisición de GPU de IA y una inmobiliaria que llamó a un escáner de mano una herramienta de IA.

Claude Code v2.1.154: Opus 4.8, Flujos de Trabajo Dinámicos y Principales Correcciones
Nueva versión añade Opus 4.8 con predeterminados de alto esfuerzo, flujos de trabajo dinámicos que orquestan decenas a cientos de agentes, modo rápido al doble de tarifa por 2.5 veces la velocidad, y más de una docena de correcciones de errores.