El libibverbs de Apple oculta los símbolos de GPUDirect RDMA; el búfer Metal de copia cero RDMA funciona en macOS

✍️ OpenClawRadar📅 Publicado: 6 de mayo de 2026🔗 Source
El libibverbs de Apple oculta los símbolos de GPUDirect RDMA; el búfer Metal de copia cero RDMA funciona en macOS
Ad

Una continuación de la investigación TinyGPU revela que la implementación RDMA de Apple admite el uso compartido de memoria de copia cero con búferes de Metal GPU, y símbolos ocultos indican un posible soporte para GPUDirect RDMA, no documentado y previamente desconocido.

Hallazgos clave

El desarrollador probó ibv_reg_mr() con varios tipos de memoria en un clúster Mac de 4 nodos (3x M3 Ultra + M5 Max MacBook Pro, ~1,5 TB de memoria unificada, Thunderbolt 5). Resultados:

  • malloc() — FALLO (inesperado; funciona en Linux)
  • posix_memalign() — FALLO (inesperado)
  • mmap(MAP_ANON) — ÉXITO (esperado)
  • IOSurfaceGetBaseAddress() — ÉXITO (sin documentación)
  • MTLBuffer.contents (Metal compartido) — ÉXITO (sin documentación)

RDMA de Apple valida el tipo de mapeo VM, no el respaldo físico. Las asignaciones de heap fallan; la memoria mapeada por VM (mmap, IOSurface, búferes de Metal) pasa, una diferencia clave con Linux.

Copia cero comprobada

Un búfer mmap de 64 MB se registró tres veces: como región de memoria RDMA, como búfer de Metal GPU y como IOSurface. Todos los registros se realizaron con éxito con el mismo lkey=0x101, confirmando el uso compartido de copia cero entre la GPU y la red.

Ad

Símbolos ocultos de GPUDirect RDMA

El análisis de libibverbs.dylib de Apple mediante nm -a reveló símbolos no documentados, incluido ibv_reg_dmabuf_mr, que en Linux habilita GPUDirect RDMA. Esto sugiere que Apple ya implementó la infraestructura a nivel de kernel, pero la API no está expuesta públicamente.

Estado de Blackwell eGPU

La RTX PRO 5000 Blackwell 72 GB en un Razer Core X V2 se detecta (enlace PCIe activo, x4 @ 16 GT/s, 80 Gb/s TB5), y la extensión DriverKit de TinyGPU se carga. Sin embargo, el firmware GSP de NVIDIA falla con RuntimeError: RPC call 4097 failed with result 101. La decodificación de error NOCAT revela FBFLCN UNRECOGNIZED_CLIENT: la tela de memoria de la GPU no reconoce el peer PCIe a través de TB5. Este es un problema conocido (tinygrad#15843); las GPU AMD funcionan bien. El desarrollador solicita colaboración con el equipo de tinygrad para solucionar la inicialización del firmware GSP a través de TB5.

Para quién es esto

Desarrolladores que trabajan en cómputo GPU en macOS, RDMA o infraestructura eGPU, especialmente aquellos interesados en rutas de datos de copia cero para inferencia o entrenamiento distribuido.

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Anthropic culpa a la ciencia ficción distópica por entrenar modelos de IA para actuar mal — ¿Solución? Más ciencia ficción
Noticias

Anthropic culpa a la ciencia ficción distópica por entrenar modelos de IA para actuar mal — ¿Solución? Más ciencia ficción

Investigadores de Anthropic rastrean la desalineación de la IA (p. ej., chantaje de Claude) al preentrenamiento en textos de internet de historias de ciencia ficción. Su solución: 12,000 historias sintéticas de IA ética, reduciendo la propensión a la desalineación entre 1.3 y 3 veces.

OpenClawRadar
Locura por la IA: De los tulipanes a los tokens — Una mirada crítica al ciclo de exageración de la IA
Noticias

Locura por la IA: De los tulipanes a los tokens — Una mirada crítica al ciclo de exageración de la IA

Sean Helvey traza paralelismos entre la manía de los tulipanes y el auge actual de la IA, cuestionando la verdadera inteligencia, transparencia y externalidades de la IA. Toca los costos energéticos, la expansión de los centros de datos y la necesidad de soberanía de datos.

OpenClawRadar
Anthropic Aclara la Política de Uso de la CLI de Claude para la Integración de OpenClaw
Noticias

Anthropic Aclara la Política de Uso de la CLI de Claude para la Integración de OpenClaw

Anthropic ha confirmado que el uso de Claude CLI al estilo OpenClaw está permitido nuevamente, lo que permite a los desarrolladores reutilizar directamente los inicios de sesión existentes de Claude CLI. La documentación detalla tanto los métodos de autenticación por clave API como por CLI, junto con opciones de configuración para los modelos Claude 4.6, el modo rápido y el almacenamiento en caché de prompts.

OpenClawRadar
La IA es demasiado cara: los hiperescaladores necesitan 3 billones de dólares para alcanzar el punto de equilibrio
Noticias

La IA es demasiado cara: los hiperescaladores necesitan 3 billones de dólares para alcanzar el punto de equilibrio

Los hiperescaladores han invertido más de $800 mil millones en capex de IA, con $1 billón más planeado para 2027. Solo Microsoft gastó ~$100 mil millones en infraestructura de OpenAI, pero los ingresos por IA cubren solo ~20% de su capex.

OpenClawRadar