El libibverbs de Apple oculta los símbolos de GPUDirect RDMA; el búfer Metal de copia cero RDMA funciona en macOS

✍️ OpenClawRadar📅 Publicado: 6 de mayo de 2026🔗 Source
El libibverbs de Apple oculta los símbolos de GPUDirect RDMA; el búfer Metal de copia cero RDMA funciona en macOS
Ad

Una continuación de la investigación TinyGPU revela que la implementación RDMA de Apple admite el uso compartido de memoria de copia cero con búferes de Metal GPU, y símbolos ocultos indican un posible soporte para GPUDirect RDMA, no documentado y previamente desconocido.

Hallazgos clave

El desarrollador probó ibv_reg_mr() con varios tipos de memoria en un clúster Mac de 4 nodos (3x M3 Ultra + M5 Max MacBook Pro, ~1,5 TB de memoria unificada, Thunderbolt 5). Resultados:

  • malloc() — FALLO (inesperado; funciona en Linux)
  • posix_memalign() — FALLO (inesperado)
  • mmap(MAP_ANON) — ÉXITO (esperado)
  • IOSurfaceGetBaseAddress() — ÉXITO (sin documentación)
  • MTLBuffer.contents (Metal compartido) — ÉXITO (sin documentación)

RDMA de Apple valida el tipo de mapeo VM, no el respaldo físico. Las asignaciones de heap fallan; la memoria mapeada por VM (mmap, IOSurface, búferes de Metal) pasa, una diferencia clave con Linux.

Copia cero comprobada

Un búfer mmap de 64 MB se registró tres veces: como región de memoria RDMA, como búfer de Metal GPU y como IOSurface. Todos los registros se realizaron con éxito con el mismo lkey=0x101, confirmando el uso compartido de copia cero entre la GPU y la red.

Ad

Símbolos ocultos de GPUDirect RDMA

El análisis de libibverbs.dylib de Apple mediante nm -a reveló símbolos no documentados, incluido ibv_reg_dmabuf_mr, que en Linux habilita GPUDirect RDMA. Esto sugiere que Apple ya implementó la infraestructura a nivel de kernel, pero la API no está expuesta públicamente.

Estado de Blackwell eGPU

La RTX PRO 5000 Blackwell 72 GB en un Razer Core X V2 se detecta (enlace PCIe activo, x4 @ 16 GT/s, 80 Gb/s TB5), y la extensión DriverKit de TinyGPU se carga. Sin embargo, el firmware GSP de NVIDIA falla con RuntimeError: RPC call 4097 failed with result 101. La decodificación de error NOCAT revela FBFLCN UNRECOGNIZED_CLIENT: la tela de memoria de la GPU no reconoce el peer PCIe a través de TB5. Este es un problema conocido (tinygrad#15843); las GPU AMD funcionan bien. El desarrollador solicita colaboración con el equipo de tinygrad para solucionar la inicialización del firmware GSP a través de TB5.

Para quién es esto

Desarrolladores que trabajan en cómputo GPU en macOS, RDMA o infraestructura eGPU, especialmente aquellos interesados en rutas de datos de copia cero para inferencia o entrenamiento distribuido.

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Claude Code v2.1.85 Lanzamiento: Mejoras en MCP, Filtros de Hook y Corrección de Errores
Noticias

Claude Code v2.1.85 Lanzamiento: Mejoras en MCP, Filtros de Hook y Corrección de Errores

Claude Code v2.1.85 agrega variables de entorno para scripts auxiliares de encabezados MCP, campos condicionales 'if' para ganchos para reducir la generación de procesos, y correcciones para fallos en /compact, problemas de habilitación/deshabilitación de complementos, y problemas de teclado en terminales Ghostty, Kitty y WezTerm.

OpenClawRadar
Comparación de rendimiento de Qwen3.5-27B en 8 bits frente a 16 bits
Noticias

Comparación de rendimiento de Qwen3.5-27B en 8 bits frente a 16 bits

Un usuario de Reddit probó Qwen3.5-27B con vLLM comparando pesos bf16 y caché KV de 16 bits contra la cuantización fp8 de Qwen con caché KV de 8 bits, encontrando resultados prácticamente idénticos en el benchmark Aider usando una RTX 6000 Pro.

OpenClawRadar
Liquid AI lanza el modelo LFM2.5-350M para bucles agentivos.
Noticias

Liquid AI lanza el modelo LFM2.5-350M para bucles agentivos.

Liquid AI lanzó LFM2.5-350M, un modelo de 350 millones de parámetros entrenado para extracción confiable de datos y uso de herramientas. Ocupa menos de 500MB cuando está cuantizado y supera a modelos más grandes como Qwen3.5-0.8B en la mayoría de los benchmarks, siendo más rápido y eficiente en memoria.

OpenClawRadar
La estrategia de pesos abiertos de Mistral: valoración de $14B en soberanía, no en puntos de referencia
Noticias

La estrategia de pesos abiertos de Mistral: valoración de $14B en soberanía, no en puntos de referencia

Mistral construyó un imperio de IA de $14 mil millones ofreciendo modelos de pesos abiertos para gobiernos y empresas que buscan independencia tecnológica de EE. UU. y China. Los ingresos alcanzaron $200 millones en 2025, con el objetivo de $80 millones/mes para diciembre de 2026.

OpenClawRadar