니들(Needle): 모바일에서 초당 6000토큰으로 실행되는 2600만 파라미터 함수 호출 모델
Cactus가 Needle을 오픈소스로 공개했습니다. Needle은 저가형 휴대폰, 시계, 안경에서 구동되도록 설계된 2600만 파라미터 함수 호출 모델입니다. 자체 추론 엔진인 Cactus를 사용하여 소비자 기기에서 6000 tok/s 프리필과 1200 tok/s 디코드를 달성합니다.
아키텍처: Simple Attention Networks
Needle은 Simple Attention Network를 사용합니다. MLP는 전혀 없으며, 모델 전체가 어텐션과 게이팅 계층으로 구성됩니다. 주요 설계: d=512, 8H/4KV, BPE=8192, 인코더-디코더 구조(12개 인코더 계층, 8개 디코더 계층)로 크로스 어텐션, RoPE를 적용한 마스크드 셀프 어텐션, 그리고 결합된 임베딩을 사용합니다.
학습 세부사항
- 16개의 TPU v6e에서 2000억 토큰으로 사전 학습 (27시간)
- 합성된 함수 호출 데이터 20억 토큰으로 후처리 학습 (45분)
- 데이터는 Gemini를 통해 15개 도구 카테고리(타이머, 메시징, 내비게이션, 스마트 홈 등)로 합성됨
벤치마크 결과
Needle은 단일 호출 함수 실행에서 FunctionGemma-270M, Qwen-0.6B, Granite-350M, LFM2.5-350M을 능가합니다. 하지만 이 모델들은 더 넓은 범위와 용량을 가지며 대화형 환경에서 뛰어납니다.
빠른 시작
git clone https://github.com/cactus-compute/needle.git
cd needle && source ./setup
needle playground웹 UI가 http://127.0.0.1:7860에서 열리며, 자체 도구로 테스트 및 파인튜닝할 수 있습니다.
사용법 (Python)
from needle import SimpleAttentionNetwork, load_checkpoint, generate, get_tokenizer
params, config = load_checkpoint("checkpoints/needle.pkl")
model = SimpleAttentionNetwork(config)
tokenizer = get_tokenizer()
result = generate(
model, params, tokenizer,
query="What's the weather in San Francisco?",
tools='[{"name":"get_weather","parameters":{"location":"string"}}]',
stream=False
)
print(result)
[{"name":"get_weather","arguments":{"location":"San Francisco"}}]
로컬 파인튜닝
# playground 사용 (Gemini로 데이터 자동 생성)
needle playground
또는 자체 데이터 제공
needle finetune data.jsonl
다운로드
가중치는 Hugging Face에서 확인 가능: Cactus-Compute/needle. 모든 것은 MIT 라이선스입니다.
📖 전체 소스 읽기: HN AI Agents
👀 See Also

LORE.md: AI 대화에서 구조화된 지식을 추출하기 위한 개방형 표준
LORE.md는 AI 대화에서 지속 가능한 지식을 구조화된 형식으로 추출하기 위한 개방형 표준입니다. 이는 근거와 함께 의사 결정, 통찰력, 패턴, 미해결 질문, 다음 단계를 포착하며, 모든 내용이 세션 간에 연결됩니다.

다중 에이전트 AI 시스템 비교: Anthropic의 Harness 대 Agyn의 엔지니어링 조직 모델
Anthropic은 장기 실행 애플리케이션 개발을 위한 하네스 설계를 발표한 반면, Agyn의 팀 기반 자율 소프트웨어 엔지니어링을 위한 다중 에이전트 시스템은 지난달 오픈소스로 공개되었습니다. 두 시스템 모두 단일 에이전트 모델을 거부하고 역할 분리, 구조화된 인계, 검토 루프를 선호합니다.

HomeButler: API 키 없이 Claude에서 홈랩 서버를 관리하는 MCP 서버
HomeButler는 Claude가 API 키 없이도 홈랩 서버에서 자체 호스팅 앱을 설치, 모니터링 및 관리할 수 있게 해주는 MCP 서버입니다. 이 도구는 로컬에서 실행되며 모든 작업을 사용자의 네트워크 내에서 유지하며 Claude Code로 구축되었습니다.

오픈소스 도구, 로컬 데이터 분석으로 AI 코딩 에이전트 자율성 측정
Codelens-AI는 Claude Code 세션 파일을 git 기록과 함께 분석하여 자율성 지표(예: 오토파일럿 비율, 자가 치유 점수)를 계산하는 오픈소스 CLI 도구입니다. 이 도구는 npx claude-roi를 사용하여 설정 없이 로컬에서 실행되며 모든 데이터를 사용자의 기기에 보관합니다.