미아즈마: AI 웹 스크레이퍼를 독성 데이터로 포획하는 도구

✍️ OpenClawRadar📅 게시일: March 29, 2026🔗 Source
미아즈마: AI 웹 스크레이퍼를 독성 데이터로 포획하는 도구
Ad

미아즈마의 기능

미아즈마는 AI 웹 스크레이퍼를 함정에 빠뜨리기 위해 중독된 훈련 데이터와 여러 개의 자기 참조 링크를 제공하도록 설계된 도구로, 개발자들이 "슬롭 머신을 위한 끝없는 슬롭 뷔페"라고 부르는 상황을 만듭니다. 이 도구는 최소한의 메모리 사용량으로 빠르게 실행되도록 구축되었습니다.

설치 및 설정

Cargo로 설치: cargo install miasma 또는 릴리스에서 미리 빌드된 바이너리를 다운로드하세요.

기본 구성으로 시작: miasma

모든 구성 옵션 보기: miasma --help

스크레이퍼를 함정에 빠뜨리는 방법

일반적인 설정은 다음과 같습니다:

  1. 사이트에 특정 경로(예: /bots)를 가리키는 숨겨진 링크를 삽입하여 인간 방문자에게는 보이지 않지만 스크레이퍼에게는 보이도록 속성을 설정합니다:
    <a href="/bots" style="display: none;" aria-hidden="true" tabindex="1">놀라운 고품질 데이터가 여기에 있습니다!</a>
  2. 해당 경로를 미아즈마로 라우팅하도록 리버스 프록시(예: Nginx)를 구성합니다:
    location ~ ^/bots($|/.*)$ {
      proxy_pass http://localhost:9855;
    }
  3. 특정 매개변수로 미아즈마를 실행합니다:
    miasma --link-prefix '/bots' -p 9855 -c 50

-c 50 플래그는 최대 동시 연결 수를 50개로 제한하며, 이는 50-60MB의 최대 메모리 사용량을 초래합니다. 이 제한을 초과하는 요청은 429 응답을 받습니다.

Ad

구성 옵션

  • --port: 기본값 9999 - 서버가 바인딩할 포트
  • --host: 기본값 localhost - 서버가 바인딩할 호스트 주소
  • --max-in-flight: 기본값 500 - 허용 가능한 최대 동시 요청 수
  • --link-prefix: 기본값 / - 자기 지시 링크의 접두사(호스팅 경로와 일치해야 함)
  • --link-count: 기본값 5 - 각 응답 페이지에 포함할 자기 지시 링크 수
  • --force-gzip: 기본값 false - Accept-Encoding 헤더와 관계없이 항상 응답을 gzip으로 압축
  • --poison-source: 기본값 https://rnsaffn.com/poison2/ - 중독된 훈련 데이터를 위한 프록시 소스

중요 고려사항

개발자들은 robots.txt 파일에서 우호적인 봇과 검색 엔진을 보호할 것을 권장합니다:

User-agent: Googlebot
User-agent: Bingbot
User-agent: DuckDuckBot
User-agent: Slurp
User-agent: SomeOtherNiceBot
Disallow: /bots
Allow: /

미아즈마는 GPL-3.0 라이선스로 제공되며, 개발자들은 "주로 AI가 생성한 기여는 자동으로 거부될 것"이라고 언급했습니다.

📖 전체 소스 읽기: HN AI Agents

Ad

👀 See Also

개발자가 Claude Code를 활용해 디자인과 SEO를 위한 AI/ML 구인 게시판을 구축했습니다
Tools

개발자가 Claude Code를 활용해 디자인과 SEO를 위한 AI/ML 구인 게시판을 구축했습니다

한 개발자가 선도적인 연구소와 기업의 AI/ML 채용 정보를 분류하여 제공하는 무료 사이트 MOAIJobs.com을 제작했습니다. 이 사이트는 카테고리, 지역, 급여별 필터링 기능을 제공하며, 디자인과 기술적 SEO 구현은 개발자가 제공한 참고 자료와 설명을 바탕으로 Claude Code가 담당했습니다.

OpenClawRadar
사서 MCP: 문서와 지속적 컨텍스트를 위한 로컬 AI 서버
Tools

사서 MCP: 문서와 지속적 컨텍스트를 위한 로컬 AI 서버

Librarian MCP는 로컬에서 실행되는 오픈소스 Model Context Protocol 서버로, Jan, LM Studio 또는 Claude Desktop에 연결하여 AI 모델이 문서 컬렉션을 검색하고 분석할 수 있게 하면서도 전체 대화 컨텍스트와 데이터 프라이버시를 유지합니다.

OpenClawRadar
MCP 파이프라인과 Claude Code를 활용한 지역 행동 모니터링 시스템
Tools

MCP 파이프라인과 Claude Code를 활용한 지역 행동 모니터링 시스템

한 개발자가 BRAIN이라는 로컬 행동 모니터링 시스템을 구축하여 앱 전환, 파일 작업, 개발 세션을 추적하고, 사용자 정의 MCP 서버를 통해 Claude Code로 데이터를 전송합니다. 이 시스템은 100% 로컬에서 실행되며 클라우드 의존성이 전혀 없습니다.

OpenClawRadar
AIBrain은 Claude Code에 지속적인 메모리와 자기 개선 기능을 추가합니다.
Tools

AIBrain은 Claude Code에 지속적인 메모리와 자기 개선 기능을 추가합니다.

AIBrain은 세션 간에 의미론적 검색 검색 및 자기 개선 주기를 통해 Claude Code에 지속적인 메모리를 제공하는 도구입니다. 53개의 워크플로우, 44개의 스킬, 9개의 MCP 서버를 포함하며 Tailscale을 통한 다중 에이전트 메시 네트워킹을 지원합니다.

OpenClawRadar