El libibverbs de Apple oculta los símbolos de GPUDirect RDMA; el búfer Metal de copia cero RDMA funciona en macOS

Una continuación de la investigación TinyGPU revela que la implementación RDMA de Apple admite el uso compartido de memoria de copia cero con búferes de Metal GPU, y símbolos ocultos indican un posible soporte para GPUDirect RDMA, no documentado y previamente desconocido.
Hallazgos clave
El desarrollador probó ibv_reg_mr() con varios tipos de memoria en un clúster Mac de 4 nodos (3x M3 Ultra + M5 Max MacBook Pro, ~1,5 TB de memoria unificada, Thunderbolt 5). Resultados:
malloc()— FALLO (inesperado; funciona en Linux)posix_memalign()— FALLO (inesperado)mmap(MAP_ANON)— ÉXITO (esperado)IOSurfaceGetBaseAddress()— ÉXITO (sin documentación)MTLBuffer.contents(Metal compartido) — ÉXITO (sin documentación)
RDMA de Apple valida el tipo de mapeo VM, no el respaldo físico. Las asignaciones de heap fallan; la memoria mapeada por VM (mmap, IOSurface, búferes de Metal) pasa, una diferencia clave con Linux.
Copia cero comprobada
Un búfer mmap de 64 MB se registró tres veces: como región de memoria RDMA, como búfer de Metal GPU y como IOSurface. Todos los registros se realizaron con éxito con el mismo lkey=0x101, confirmando el uso compartido de copia cero entre la GPU y la red.
Símbolos ocultos de GPUDirect RDMA
El análisis de libibverbs.dylib de Apple mediante nm -a reveló símbolos no documentados, incluido ibv_reg_dmabuf_mr, que en Linux habilita GPUDirect RDMA. Esto sugiere que Apple ya implementó la infraestructura a nivel de kernel, pero la API no está expuesta públicamente.
Estado de Blackwell eGPU
La RTX PRO 5000 Blackwell 72 GB en un Razer Core X V2 se detecta (enlace PCIe activo, x4 @ 16 GT/s, 80 Gb/s TB5), y la extensión DriverKit de TinyGPU se carga. Sin embargo, el firmware GSP de NVIDIA falla con RuntimeError: RPC call 4097 failed with result 101. La decodificación de error NOCAT revela FBFLCN UNRECOGNIZED_CLIENT: la tela de memoria de la GPU no reconoce el peer PCIe a través de TB5. Este es un problema conocido (tinygrad#15843); las GPU AMD funcionan bien. El desarrollador solicita colaboración con el equipo de tinygrad para solucionar la inicialización del firmware GSP a través de TB5.
Para quién es esto
Desarrolladores que trabajan en cómputo GPU en macOS, RDMA o infraestructura eGPU, especialmente aquellos interesados en rutas de datos de copia cero para inferencia o entrenamiento distribuido.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Claude Code v2.1.85 Lanzamiento: Mejoras en MCP, Filtros de Hook y Corrección de Errores
Claude Code v2.1.85 agrega variables de entorno para scripts auxiliares de encabezados MCP, campos condicionales 'if' para ganchos para reducir la generación de procesos, y correcciones para fallos en /compact, problemas de habilitación/deshabilitación de complementos, y problemas de teclado en terminales Ghostty, Kitty y WezTerm.

Comparación de rendimiento de Qwen3.5-27B en 8 bits frente a 16 bits
Un usuario de Reddit probó Qwen3.5-27B con vLLM comparando pesos bf16 y caché KV de 16 bits contra la cuantización fp8 de Qwen con caché KV de 8 bits, encontrando resultados prácticamente idénticos en el benchmark Aider usando una RTX 6000 Pro.

Liquid AI lanza el modelo LFM2.5-350M para bucles agentivos.
Liquid AI lanzó LFM2.5-350M, un modelo de 350 millones de parámetros entrenado para extracción confiable de datos y uso de herramientas. Ocupa menos de 500MB cuando está cuantizado y supera a modelos más grandes como Qwen3.5-0.8B en la mayoría de los benchmarks, siendo más rápido y eficiente en memoria.

La estrategia de pesos abiertos de Mistral: valoración de $14B en soberanía, no en puntos de referencia
Mistral construyó un imperio de IA de $14 mil millones ofreciendo modelos de pesos abiertos para gobiernos y empresas que buscan independencia tecnológica de EE. UU. y China. Los ingresos alcanzaron $200 millones en 2025, con el objetivo de $80 millones/mes para diciembre de 2026.