PageAgent: Ollama 지원으로 웹 페이지 내에서 실행되는 브라우저 AI 에이전트

PageAgent의 기능
PageAgent는 Playwright나 Selenium처럼 브라우저 외부에서 제어하는 대부분의 프레임워크와 달리, 웹 페이지 자체 내에서 JavaScript 라이브러리로 실행되는 브라우저 AI 에이전트 프레임워크입니다.
주요 기술적 특징
에이전트는 라이브 DOM을 텍스트로 읽어들여 스크린샷이나 비전 모델이 필요 없어 더 빠르고 토큰 효율적입니다.
Ollama를 포함한 모든 OpenAI 호환 엔드포인트와 작동합니다. 로컬 모델과 함께 사용하면 백엔드나 클라우드 없이 모든 것이 사용자의 기기에 유지되며, LLM 호출이 브라우저에서 localhost로 직접 전송됩니다.
코드 예시
const agent = new PageAgent({
model: 'qwen3.5:27b',
baseURL: 'http://localhost:11434/v1',
})
await agent.execute('지난 금요일 지출 보고서 작성하기')추가 기능
- 에이전트의 사고 과정을 확인하고 언제든지 중단하거나 수정할 수 있는 인간 개입 패널
- 다중 탭 작업을 위한 선택적 브라우저 확장 프로그램
- MIT 라이선스
프로젝트는 GitHub의 alibaba/page-agent에서 확인할 수 있습니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

16개의 GPU로 카파시의 자동 연구 확장: 결과와 방법
SkyPilot 팀이 Claude Code에 Kubernetes 클러스터의 16개 GPU에 대한 접근 권한을 부여하여 Karpathy의 Autoresearch 프로젝트를 실행했습니다. 8시간 동안 에이전트는 약 910개의 실험을 제출했고, 검증 비트/바이트를 1.003에서 0.974로 감소시켰으며(2.87% 개선), 순차 실행보다 9배 빠르게 최고의 검증 손실에 도달했습니다.

the-knowledge-guy: 클로드 코드 스킬로 책장을 튜터로 바꾸다
PDF/EPUB 책을 로컬에서 읽어들이고 질문에 답하거나 주제별로 학습하거나 치트시트를 뽑아낼 수 있는 Claude Code 스킬 세트입니다. 모든 인용은 라이브러리 전체에서 이루어집니다.

클로드 코드 vs. 코덱스: 실제 빌드 테스트 – 36개 파일 대 28개 파일, 무한 루프, 0.46달러 비용 차이
한 개발자가 Claude Code와 Cursor의 Codex를 실제 두 가지 작업(PR 분류 봇과 WebSocket 코드 리뷰 UI)으로 비교했습니다. Claude는 12분 만에 36개 파일을 구축했고 TypeScript 오류가 전혀 없었습니다. Codex는 작동하는 UI를 만들었지만 무한 React 루프에 빠졌습니다. 비용 차이는 약 $0.46이었습니다.

MCP 파이프라인과 Claude Code를 활용한 지역 행동 모니터링 시스템
한 개발자가 BRAIN이라는 로컬 행동 모니터링 시스템을 구축하여 앱 전환, 파일 작업, 개발 세션을 추적하고, 사용자 정의 MCP 서버를 통해 Claude Code로 데이터를 전송합니다. 이 시스템은 100% 로컬에서 실행되며 클라우드 의존성이 전혀 없습니다.