세레브라스, 메모리 사용량 40% 감소한 Step-3.5-Flash-REAP 모델 출시

이것이 무엇인가요
Cerebras는 더 큰 모델의 메모리 효율적인 압축 변형인 Step-3.5-Flash-REAP 모델을 출시했습니다. 이는 출처에서 "감자 같은 설정"이라고 부르는 환경을 위해 설계된 더 작은 버전이지만, 121B 파라미터 모델은 여전히 상당한 리소스를 필요로 합니다.
출처의 주요 세부 사항
이 모델들은 Hugging Face에서 이용 가능합니다:
Step-3.5-Flash-REAP-121B-A11B 모델은 196B에서 121B 파라미터로 압축되어, 전체 모델과 거의 동일한 성능을 유지하면서 40%의 메모리 감소를 나타냅니다.
압축에는 REAP(Router-weighted Expert Activation Pruning)이 사용되며, 이는 "남은 전문가들에 대한 라우터의 독립적인 제어를 유지하면서 중복된 전문가들을 선택적으로 제거하는 새로운 전문가 가지치기 방법"으로 설명됩니다.
기능과 능력
- 거의 손실 없는 성능: 코드 생성, 에이전트 코딩, 함수 호출 작업에서 전체 196B 모델과 비교해 거의 동일한 정확도를 유지합니다
- 40% 메모리 감소: 196B에서 121B 파라미터로 압축되어 배포 비용과 메모리 요구 사항을 낮춥니다
- 보존된 능력: 코드 생성, 수학 및 추론, 도구 호출을 포함한 모든 핵심 기능을 유지합니다
- 즉시 호환성: 기본 vLLM과 작동합니다 - 소스 수정이나 사용자 정의 패치가 필요하지 않습니다
- 실제 사용에 최적화: 리소스가 제한된 환경, 로컬 배포, 학술 연구에 특히 효과적입니다
출처는 이들이 "더 작은 버전"이지만, 121B 모델은 압축에도 불구하고 여전히 상당히 강력한 설정을 필요로 한다고 언급합니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

Claude-Code v2.1.41 릴리스: 주요 업데이트 및 수정 사항
Claude-Code v2.1.41는 AWS 인증 갱신 개선, Windows ARM64 지원, 다양한 도구 및 UI 요소 수정을 도입합니다.

AI 모델은 자체 도구와 사용자 인터페이스에 대한 자가 인식이 부족합니다.
ChatGPT 및 Claude와 같은 AI 모델은 제품이 지속적으로 진화하는 반면 과거 데이터 스냅샷으로 학습되기 때문에, 새로운 슬래시 명령어의 존재를 부정하거나 오래된 UI 버전을 설명하는 등 자체 기능과 인터페이스에 대해 부정확하거나 오래된 정보를 자주 제공합니다.
발견된 소재: AI 에이전트가 500개 이상의 신소재를 발견했지만, 합성 경로가 타당한 것은 단 1개뿐
Discovered Materials(YC P26)는 최첨단 LLM을 사용하여 500개 이상의 새로운 반도체 재료를 컴퓨터로 발견했습니다. 그중 단 하나만이 실현 가능한 합성 경로를 가지고 있어 실험실에서 공장까지의 격차를 강조합니다.

추론 가격 분석 결과, 동일 모델에 대해 제공업체 간 4.4배 가격 차이 확인
Llama 3.1 70B Instruct 모델의 추론 가격 분석 결과 제공업체 간 4.4배의 비용 차이가 나타났으며, DeepInfra는 백만 토큰당 $0.20/$0.27, Together는 $0.88/$0.88로 책정되었습니다. 추론 모델의 경우 DeepSeek R1과 OpenAI o1 간에 약 30배의 가격 차이가 관찰되었습니다.