ScreenMind: 로컬 우선 AI 메모리, 컴퓨터 전체 활동을 인덱싱하다

ScreenMind는 로컬 우선 AI 메모리 시스템으로, 컴퓨터 화면을 지속적으로 캡처하고, 회의를 자동으로 전사하며, 음성 메모를 인덱싱하여 사용자의 모든 활동을 검색 가능한 타임라인으로 구성합니다. 지각적 해싱(perceptual hashing)을 사용해 콘텐츠가 변경될 때만 기록하며, 각 프레임을 llama.cpp를 통해 Gemma 4 E2B로 전달하여 비전 분석, 채팅, 오디오 처리를 수행합니다.
주요 기능
- 화면 캡처 — 지각적 해싱으로 콘텐츠가 변경될 때만 저장
- 검색 가능한 타임라인 — 과거 활동 질의: "아까 그 에러 메시지", "오후 3시에 뭐 하고 있었지?"
- 과거와 대화 — 전체 세션의 AI 컨텍스트 유지
- 회의 전사 — Zoom, Teams, Google Meet 자동 감지
- 음성 메모 — Gemma 4 오디오 인코더로 처리
- 자연어 자동화 — 평문 영어 Markdown으로 작성
- MCP 통합 — Claude와 Cursor 연결
기술 스택
- 모델: Gemma 4 E2B (비전, 채팅, 오디오 처리)
- 백엔드: Python + FastAPI
- 저장소: SQLite
- 추론: Q4 양자화된 llama.cpp
- 하드웨어: 4GB 이상 VRAM
저자는 비전, 채팅, 오디오 작업 간의 GPU 스케줄링이 주요 추론 최적화 과제라고 언급합니다. 이 프로젝트는 아직 완전 자동화보다는 워크플로 중심이며, 검색 품질과 온보딩 편의성 개선이 필요합니다.
GitHub: ayushh0110/ScreenMind
📖 전체 원문 보기: r/LocalLLaMA
👀 See Also

Superglue CLI: 사전 구축된 도구 없이 AI 에이전트가 API 호출을 실행할 수 있게 합니다
Superglue CLI는 AI 코딩 에이전트에게 명령어 사용법, 인증 처리, 도구 구축, 실패 디버깅 방법을 가르치는 스킬을 제공합니다. 모든 API 통합을 위한 사전 제작된 도구를 만드는 대신, 에이전트는 런타임에 API 사양을 읽고 다단계 호출을 계획할 수 있습니다.

T9OS: 클로드 코드로 완전히 구축된 AI 오케스트레이션 시스템
경제학과 학생이 Claude Code를 유일한 프로그래밍 도구로 사용하여 완전한 AI 오케스트레이션 계층인 T9OS를 구축했습니다. 이 시스템은 18개의 프로덕션 파이프라인, 12단계 생명주기 엔진, 모든 출력을 검토하는 7개의 AI '가디언'을 포함합니다.

LLM 에이전트가 시각적 피드백을 활용하여 완전한 Godot 4 던전 크롤러를 구축합니다
한 개발자가 MCP 도구를 사용해 LLM 에이전트를 Godot 4에 연결하고, 던전 크롤러 FPS를 만들라는 단일 프롬프트를 주었습니다. 에이전트는 게임을 실행하고 스크린샷을 찍어 시각적 문제를 수정하며, 3개의 방, 조명, 전투, 적, 진행 시스템을 갖춘 완전한 프로토타입을 만들었습니다.

MCP 서버는 쿠키와 인증 정보를 사용하여 AI 에이전트를 기존 Chrome 세션에 연결합니다.
@playwright-repl/mcp는 Dramaturg 확장 프로그램을 통해 AI 에이전트가 기존 Chrome 브라우저에 연결할 수 있는 MCP 서버로, 쿠키와 인증을 포함한 실제 브라우저 세션에 접근할 수 있습니다. 전체 Playwright JavaScript와 어설션을 지원하며 Claude Desktop, Claude Code, Cursor 또는 모든 MCP 클라이언트와 함께 작동합니다.