NVIDIA Groq 3 LPX在长上下文基准测试中达到每秒3431个Token

✍️ OpenClawRadar📅 게시일: August 25, 2026🔗 Source
Ad

NVIDIA의 Groq 3 LPX는 Vera Rubin 플랫폼용 대화형 추론 가속기로, 첫 번째 타사 벤치마크에서 Gemma 4 31B 모델을 사용한 Artificial Analysis의 100K 컨텍스트 벤치마크에서 초당 3,431개의 출력 토큰을 기록했습니다. 이 결과는 '고상호작용' 서비스 계층, 즉 수십만 토큰으로 컨텍스트가 늘어나는 다중 턴 에이전트 세션에 필요한 응답성을 목표로 합니다.

긴 컨텍스트 + 상호작용이 어려운 이유

에이전트 워크로드는 다중 턴입니다: 각 턴은 출력을 컨텍스트에 추가하고, 이후 턴은 이전의 모든 것을 다시 처리해야 합니다. 100K 이상의 입력 토큰에서 대용량 KV 캐시를 관리하면서 사용자당 초당 3,000개 이상의 토큰을 제공하는 것은 시스템 문제입니다. 표준적인 방법인 텐서 병렬 처리(TP)는 칩에 계산을 분할하지만, 대화형 지연 시간에 필요한 매우 작은 배치 크기에서는 조정(집합 연산)의 고정 비용이 속도 향상을 잠식할 수 있습니다.

병목 현상은 대역폭이 아니라 첫 비트 지연 시간입니다. 기사에서 언급했듯이, 작은 텐서의 경우 전송 시간은 데이터 양(N)을 대역폭(B)으로 나눈 값보다 지연 시간(A)에 의해 지배됩니다.

Ad

Groq 3 LPX의 접근 방식

Groq 3 LPX는 결정적이고 컴파일러가 스케줄링하는 워크로드 계획으로 이를 해결합니다. 컴파일러는 모든 텐서의 출발 및 도착 시간을 미리 스케줄링하여 계산과 통신을 세밀하게 겹칩니다. 사전 계획된 칩 간 네트워킹은 첫 비트 지연 시간을 최소화하여 배치 크기 1에서도 TP를 효과적으로 만듭니다.

에이전트 및 코딩 관련 작업을 측정하는 SPEED-Bench에서 Groq 3 LPX는 중앙값 초당 4,767개의 출력 토큰을 달성했습니다. 또한 이 시스템은 Vera Rubin NVL72와 함께 여러 배포 구성을 지원합니다:

  • 프리필-디코드 분리
  • 어텐션-FFN 분리
  • 투기적 외부 드래프터 디코딩

이러한 구성은 수조 개의 파라미터 모델로 확장하여 Groq 3 LPX의 상호작용성과 Vera Rubin의 처리량을 결합한 대규모 AI 팩토리를 구현할 수 있습니다.

이를 위한 대상

긴 컨텍스트에서 높은 상호작용성을 요구하는 에이전트 시스템을 구축하는 개발자, 특히 2조 개 이상의 파라미터 모델에서 다중 에이전트 워크플로우를 실행하는 개발자는 이 벤치마크가 인프라 계획에 관련이 있음을 알게 될 것입니다.

📖 전체 소스 읽기: HN AI Agents

Ad

👀 See Also