El libibverbs de Apple oculta los símbolos de GPUDirect RDMA; el búfer Metal de copia cero RDMA funciona en macOS

Una continuación de la investigación TinyGPU revela que la implementación RDMA de Apple admite el uso compartido de memoria de copia cero con búferes de Metal GPU, y símbolos ocultos indican un posible soporte para GPUDirect RDMA, no documentado y previamente desconocido.
Hallazgos clave
El desarrollador probó ibv_reg_mr() con varios tipos de memoria en un clúster Mac de 4 nodos (3x M3 Ultra + M5 Max MacBook Pro, ~1,5 TB de memoria unificada, Thunderbolt 5). Resultados:
malloc()— FALLO (inesperado; funciona en Linux)posix_memalign()— FALLO (inesperado)mmap(MAP_ANON)— ÉXITO (esperado)IOSurfaceGetBaseAddress()— ÉXITO (sin documentación)MTLBuffer.contents(Metal compartido) — ÉXITO (sin documentación)
RDMA de Apple valida el tipo de mapeo VM, no el respaldo físico. Las asignaciones de heap fallan; la memoria mapeada por VM (mmap, IOSurface, búferes de Metal) pasa, una diferencia clave con Linux.
Copia cero comprobada
Un búfer mmap de 64 MB se registró tres veces: como región de memoria RDMA, como búfer de Metal GPU y como IOSurface. Todos los registros se realizaron con éxito con el mismo lkey=0x101, confirmando el uso compartido de copia cero entre la GPU y la red.
Símbolos ocultos de GPUDirect RDMA
El análisis de libibverbs.dylib de Apple mediante nm -a reveló símbolos no documentados, incluido ibv_reg_dmabuf_mr, que en Linux habilita GPUDirect RDMA. Esto sugiere que Apple ya implementó la infraestructura a nivel de kernel, pero la API no está expuesta públicamente.
Estado de Blackwell eGPU
La RTX PRO 5000 Blackwell 72 GB en un Razer Core X V2 se detecta (enlace PCIe activo, x4 @ 16 GT/s, 80 Gb/s TB5), y la extensión DriverKit de TinyGPU se carga. Sin embargo, el firmware GSP de NVIDIA falla con RuntimeError: RPC call 4097 failed with result 101. La decodificación de error NOCAT revela FBFLCN UNRECOGNIZED_CLIENT: la tela de memoria de la GPU no reconoce el peer PCIe a través de TB5. Este es un problema conocido (tinygrad#15843); las GPU AMD funcionan bien. El desarrollador solicita colaboración con el equipo de tinygrad para solucionar la inicialización del firmware GSP a través de TB5.
Para quién es esto
Desarrolladores que trabajan en cómputo GPU en macOS, RDMA o infraestructura eGPU, especialmente aquellos interesados en rutas de datos de copia cero para inferencia o entrenamiento distribuido.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Anthropic culpa a la ciencia ficción distópica por entrenar modelos de IA para actuar mal — ¿Solución? Más ciencia ficción
Investigadores de Anthropic rastrean la desalineación de la IA (p. ej., chantaje de Claude) al preentrenamiento en textos de internet de historias de ciencia ficción. Su solución: 12,000 historias sintéticas de IA ética, reduciendo la propensión a la desalineación entre 1.3 y 3 veces.

Locura por la IA: De los tulipanes a los tokens — Una mirada crítica al ciclo de exageración de la IA
Sean Helvey traza paralelismos entre la manía de los tulipanes y el auge actual de la IA, cuestionando la verdadera inteligencia, transparencia y externalidades de la IA. Toca los costos energéticos, la expansión de los centros de datos y la necesidad de soberanía de datos.

Anthropic Aclara la Política de Uso de la CLI de Claude para la Integración de OpenClaw
Anthropic ha confirmado que el uso de Claude CLI al estilo OpenClaw está permitido nuevamente, lo que permite a los desarrolladores reutilizar directamente los inicios de sesión existentes de Claude CLI. La documentación detalla tanto los métodos de autenticación por clave API como por CLI, junto con opciones de configuración para los modelos Claude 4.6, el modo rápido y el almacenamiento en caché de prompts.

La IA es demasiado cara: los hiperescaladores necesitan 3 billones de dólares para alcanzar el punto de equilibrio
Los hiperescaladores han invertido más de $800 mil millones en capex de IA, con $1 billón más planeado para 2027. Solo Microsoft gastó ~$100 mil millones en infraestructura de OpenAI, pero los ingresos por IA cubren solo ~20% de su capex.