로컬 AI 동반자 에이전트 구축에서 얻은 실용적인 교훈

✍️ OpenClawRadar📅 게시일: March 24, 2026🔗 Source
로컬 AI 동반자 에이전트 구축에서 얻은 실용적인 교훈
Ad

설정 및 아키텍처

한 개발자가 M4 Mac mini에서 자체 호스팅 AI 에이전트를 몇 달간 운영해왔습니다. 이 설정은 빠른 로컬 추론을 위해 Ollama에서 qwen2.5:14b를 사용하는 Rust 런타임을 활용합니다. 시스템은 작업에 더 많은 역량이 필요할 때 클라우드 모델로 확장되는 모델 사다리를 구현합니다. 메모리는 SQLite와 세션 간 의미적 회상을 위한 nomic-embed-text를 사용한 로컬 임베딩으로 처리됩니다. 에이전트는 launchd를 통해 24/7 실행되며, 트레이딩 봇 모니터링, 이메일 확인, 웹사이트 배포, 태스크 러너를 통해 Claude Code에 무거운 구현 작업을 위임하는 등 다양한 작업을 수행합니다.

Ad

주요 교훈

메모리 아키텍처가 전부입니다: 개발자는 BM25 키워드 검색과 벡터 유사성을 가중치를 두고 병합한 하이브리드 회상이 돌파구였다는 사실을 발견했습니다. 좋은 메모리 회상을 갖춘 14B 모델은 모든 대화를 처음부터 시작하는 70B 모델보다 성능이 뛰어납니다.

시스템 프롬프트 부담은 현실입니다: 초기 신원 파일은 약 10K 토큰으로 시작했지만, 에이전트가 필요할 때 조회할 수 있는 모든 내용을 제거하여 약 2,800 토큰으로 줄였습니다. 규칙은 다음과 같습니다: 에이전트가 가끔 필요한 것이 있다면 메모리에 넣고, 모든 메시지마다 필요한 것이 있다면 시스템 프롬프트에 넣으세요.

로컬 임베딩이 경제성을 바꿨습니다: 대화 모델과 함께 Ollama에서 nomic-embed-text를 사용하면 모든 메모리 저장 및 회상 작업이 무료가 되어, 이전에 OpenAI 임베딩 요청으로 누적되던 비용을 제거합니다.

기본 모델보다 모델 사다리가 더 중요합니다: 에이전트는 기본적으로 대화를 위해 로컬 qwen을 사용하지만(무료, 빠름), 작업 요구 사항에 따라 Minimax, Kimi, Haiku, Sonnet 또는 Opus로 확장할 수 있습니다. 핵심 통찰: 추론 작업에는 /model sonnet을, 채팅에는 /model qwen과 같은 명령으로 수동으로 모델을 전환하도록 하고, 자동 감지하려고 시도하지 마세요.

도구 반복 제한에는 여유가 필요합니다: 메시지당 최대 10개의 도구 호출로 시작하는 것은 불충분한 것으로 판명되었습니다. 간단한 작업은 3-5개의 도구 호출을 소모하는 반면, 복잡한 작업은 15-20개가 필요합니다. 현재 설정은 안전망으로 시간당 200개 작업 속도 제한과 함께 25개의 도구 호출을 사용합니다.

가장 어려운 버그는 세션 간 메모리였습니다: 저장 도구를 통해 명시적으로 저장된 메모리에는 초기에 session_id가 없었고, 회상 쿼리는 현재 session_id로 필터링되었습니다. 이로 인해 의도적으로 기억된 사실이 향후 세션에서 보이지 않게 되었습니다. 해결책은 SQL 쿼리에 OR session_id IS NULL을 추가하는 것이었습니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

스타트업 창업자, 고객 지원 및 경쟁사 조사에 AI 에이전트 활용
Use Cases

스타트업 창업자, 고객 지원 및 경쟁사 조사에 AI 에이전트 활용

한 스타트업 창업자가 AI 에이전트를 문서에 연결하여 고객 지원을 자동화하여 하루 2시간에서 20분으로 시간을 단축하고, 매주 경쟁사 연구 요약을 Slack으로 전달하도록 설정했습니다.

OpenClawRadar
비개발자를 위한 Claude Desktop 파일 시스템 프로젝트 관리 설정
Use Cases

비개발자를 위한 Claude Desktop 파일 시스템 프로젝트 관리 설정

레딧 사용자가 Claude의 파일 시스템 및 협업 기능을 사용하여 여러 장기 프로젝트를 관리하는 시스템을 공유합니다. 이 설정은 WORKFLOW.txt를 진입점으로 하는 표준화된 디렉터리 구조를 사용하며, 세션 간 연속성을 유지하기 위한 특정 프로젝트 지침을 포함합니다.

OpenClawRadar
OpenClaw 어시스턴트가 사용자 정의 라우팅을 갖춘 도커화된 터미널 어시스턴트를 생성합니다
Use Cases

OpenClaw 어시스턴트가 사용자 정의 라우팅을 갖춘 도커화된 터미널 어시스턴트를 생성합니다

OpenClaw 사용자가 자신의 메인 어시스턴트가 Docker 내에서 자체 작업 공간, 메모리, 터미널 우선 동작을 갖춘 두 번째 어시스턴트를 생성하는 데 도움을 준 사례를 보고했습니다. 'meow:'로 시작하는 메시지는 메인 채팅 인터페이스 대신 컨테이너화된 터미널 어시스턴트로 전달됩니다.

OpenClawRadar
클로드를 활용하여 €3,000 프리랜서 견적을 대체한 LinkedIn 리드 생성 파이프라인 구축
Use Cases

클로드를 활용하여 €3,000 프리랜서 견적을 대체한 LinkedIn 리드 생성 파이프라인 구축

한 개발자가 Claude Sonnet을 사용하여 상세한 2페이지 분량의 프롬프트를 30분 동안 작성해 LinkedIn 리드 생성 시스템을 구축했습니다. 이 시스템은 리드 마그넷 게시물을 식별하고, 잠재 고객을 필터링 및 점수화하며, 5달러 VPS에서 매일 실행되어 프리랜서들이 2,000~5,000유로를 요구하는 견적을 대체합니다.

OpenClawRadar