V100 Cluster vs. MoE: Construcción de 12x SXM2 32GB con Orquestación de Claude Code

Un abogado que opera un clúster de 12 V100 32GB SXM2 en un Threadripper Pro informa que en las GPU Volta (capacidad de cómputo 7.0), solo los modelos MoE ofrecen velocidades de decodificación utilizables. Los modelos densos son una trampa: incluso un modelo denso de 27-32B tiene dificultades a 20-28 tok/s, muy por debajo del umbral de 40 tok/s. En contraste, Qwen3.5-122B-A10B (122B total, 10B activos) alcanza ~50 tok/s en una sola placa de 4 GPU con NVLink, y Gemma-4-26B-A4B logra ~113 tok/s. Todos los benchmarks usan Q8 GGUF con caché KV Q4 y flash-attention activado.
Configuración de Hardware
La construcción final: doce V100-SXM2 de 32GB en un Threadripper Pro. Dos placas NVLink (4 GPU cada una) más dos pares mixtos. La placa A ocupa las GPU {4,5,8,9}, la placa B {6,7,10,11}. Un par NVLink está en {0,1} y un par mixto en {2,3}, donde una tarjeta es de 16GB. Los saltos entre placas atraviesan PCIe/NUMA en lugar de NVLink, matando el rendimiento. Todos los modelos se mantienen dentro de una sola placa.
Se agregó una segunda máquina: EPYC 7302P, 512GB RAM, 4x RTX 3090 + 2x V100-PCIe, ejecutando Ollama para modelos más pequeños.
Cambio de Stack: vLLM → llama.cpp
El operador abandonó vLLM porque los modelos que realmente quiere son MoE GGUFs, y vLLM en Volta es un callejón sin salida para ellos: los kernels FP8/AWQ/Marlin requieren SM75+, y los kernels GPTQ están rotos en compute 7.0. Se mudó a llama.cpp principal, que recientemente corrigió un bug en el parser de chat de Gemma que distorsionaba prompts largos.
Orquestación con Claude Code
El sistema no es un solo modelo respondiendo un chat: un orquestador (impulsado por Claude Code) distribuye tareas legales entre varios modelos locales, cada uno fijado a su propia placa para evitar contención de GPU. Para el trabajo más pesado (declaración jurada o moción completa, desde ingreso hasta documento), las 16 GPU en ambas máquinas están activas:
- Redacción principal: Qwen3.6-35B-A3B en la Placa A
- Razonamiento pesado + redacción de alto riesgo: Qwen3.5-122B-A10B en la Placa B
- Modelo de puerta: modelo pequeño en el par {0,1} verifica si hay fundamentos
- Revisor adversarial: ataca el borrador en el par {2,3}
- Finanzas/extracción: Gemma-4-26B en las 3090s vía Ollama
Este es un pipeline secuencial (los modelos no operan todos a la vez), pero los 16 permanecen residentes en la memoria de las GPU.
Lecciones Prácticas
- Alucinación: Los modelos locales inventan citas y fechas con confianza. Un verificador revisa cada cita, fecha y número Bates contra el material fuente y bloquea contenido sin fundamento. Un revisor adversarial actúa en la cima.
- Envenenamiento del pipeline: El constructor de paquetes de evidencia estaba recogiendo sus propias salidas anteriores como evidencia del cliente, haciendo que los modelos se "fundamentaran" en basura que ellos mismos escribieron antes — un borrador citó una RTX 3060 como número Bates. Solucionado limpiando el historial de entrada del constructor.
Las tareas más ligeras usan mucho menos: combinar y sellar con Bates los documentos es puramente CPU (PyMuPDF + Tesseract), y los resúmenes simples solo tocan Gemma y el enrutador.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

Desarrollador Construye y Envía Juego Móvil Usando Código Claude
Un desarrollador utilizó Claude Code para crear y lanzar un juego móvil completo llamado Blaster Balls, un juego de rompecabezas basado en física para Android. La IA manejó los sistemas centrales de juego, la estructura del proyecto, las superposiciones de interfaz de usuario y la iteración de funciones, mientras que el desarrollador se centró en la sensación del juego, la mecánica y la monetización.

Optimización de Flujos de Trabajo Multi-AI con OpenClaw y MemOS
OpenClaw, combinado con modelos grandes y MemOS, mejora la estabilidad del flujo de trabajo multi-AI al gestionar el contexto y la memoria de manera efectiva.

Informe de Campo: Socio de Investigación en IA No Supera la Revisión por Pares, lo que Impulsa la Codificación de Metodología
Un geólogo/geofísico que utiliza Claude Opus para proyectos complejos de múltiples archivos y semanas informó sobre un fallo en el análisis de investigación asistida por IA. El usuario solicitó a Claude que evaluara críticamente un estudio financiado por la industria eólica marina que reportaba altas tasas de evitación de aves en turbinas eólicas. Claude produjo un análisis confiado de seis puntos con citas reales y una presentación fluida.

Pestaña de Documentos para Claude Desktop: Una Readaptación de la Pestaña de Código para Trabajadores del Conocimiento
Una propuesta en Reddit sugiere reutilizar el bucle de agente y el espacio de trabajo git de la pestaña Código de Claude Desktop para crear una pestaña 'Documentos' centrada en markdown para equipos de cumplimiento, legales y operaciones, ocultando la terminología de desarrollador tras etiquetas familiares de flujo de trabajo documental.