AskAlf: 셀프 호스팅 AI 워크플로우를 위한 오픈소스 멀티 에이전트 오케스트레이션 플랫폼

AskAlf의 기능
AskAlf는 자체 하드웨어에서 실행되도록 설계된 오픈소스 멀티 에이전트 오케스트레이션 플랫폼입니다. 단일 에이전트 도구와 달리, 자율 시스템을 통해 조율되는 전문 작업자를 동적으로 생성합니다.
주요 기술 특징
- 의미적, 일화적, 절차적 메모리를 결합한 10계층 인지 메모리 시스템
- PostgreSQL과 pgvector 확장을 사용한 메모리 저장
- 자체 지식을 검토하고 문제 발견 시 조사 티켓을 생성하는 자율 시스템
- 적절한 작업자에게 티켓을 배치하고 해결 상황을 추적
- 시간이 지남에 따라 유용한 패턴을 강화하는 메모리 통합 (예: 100번째 보안 스캔은 정확히 어디를 살펴봐야 할지 앎)
현재 구현 사항
- AI 제공자로 Claude와 OpenAI 사용
- 아키텍처는 모델에 독립적
- 로컬 모델 지원 (Ollama, vLLM)은 계획 중
기술 스택
TypeScript, PostgreSQL + pgvector, Redis, Docker, MCP Protocol로 구축되었습니다.
설치
curl을 통한 빠른 설치:
curl -fsSL https://get.askalf.org | bash소스 및 저장소
GitHub 저장소: https://github.com/askalf/askalf
📖 Read the full source: r/LocalLLaMA
👀 See Also

Mengram은 OpenClaw 에이전트에 영구 메모리를 추가합니다.
멍그램은 오픈클로우 에이전트에게 세션 간 장기 기억을 제공하는 오픈소스 메모리 시스템으로, 에이전트가 재시작할 때 모든 것을 잊어버리는 문제를 해결합니다. 이 시스템은 사건, 개체, 절차적 기억을 제공하며 오래되거나 부정확한 사실을 지능적으로 보관합니다.

번개 MLX: 애플 실리콘 에이전트 사용을 위한 초고속 로컬 AI 엔진, Qwen 35B-A3B에서 220 tok/s 구현
Lightning MLX는 Apple Silicon에서 가장 빠른 로컬 AI 추론을 제공하며, 코딩 에이전트와 도구 호출에 최적화되었다고 주장합니다. 벤치마크에 따르면 MacBook Max M5(128GB)에서 Qwen3.6-27B는 40.67 tok/s, Qwen3.6-35B-A3B는 220.86 tok/s를 기록했습니다.

Relay CLI 도구는 속도 제한 시 Claude 세션 컨텍스트를 저장합니다.
Relay는 Rust CLI 도구로, Claude의 .jsonl 세션 기록을 디스크에서 읽어와 대화, 도구 호출, 할 일 목록, git 상태, 오류를 포함한 세션의 전체 스냅샷을 생성합니다. 속도 제한이 초기화된 후 세션을 재개하기 위한 컨텍스트 프롬프트를 생성합니다.

SpruceChat은 llama.cpp를 통해 Miyoo 휴대용 기기에서 0.5B LLM을 온디바이스로 실행합니다.
SpruceChat는 llama.cpp를 사용하여 휴대용 게임 장치에서 Qwen2.5-0.5B를 완전히 온디바이스로 실행합니다. 클라우드나 WiFi가 필요하지 않습니다. Miyoo A30(Cortex-A7 쿼드코어)에서 약 60초 내에 로드되며 초당 약 1-2 토큰을 생성합니다.