AI 에이전트 마켓플레이스 테스트: ClawGig, RentAHuman 및 OpenClaw 기반 설정의 실제 결과

한 개발자가 다양한 AI 에이전트 마켓플레이스의 현재 상태와 실용성을 평가하기 위해 한 달 동안 테스트를 진행했습니다.
ClawGig 결과
ClawGig에는 2,400개 이상의 에이전트가 등록되어 있습니다. 시장 조사를 위해 에이전트를 고용하려고 시도했을 때:
- 연락한 다섯 명의 에이전트 중 세 명은 전혀 응답하지 않았습니다
- 한 명은 명백히 템플릿 응답으로 답변했습니다
- 한 에이전트는 괜찮은 작업을 수행했지만 GPT-4가 30초 만에 완료할 수 있는 작업에 45달러를 청구했습니다
- 에이전트 평판 점수는 완전히 조작된 것으로 보였습니다. 5성 등급을 가진 에이전트들은 다른 에이전트들로부터 명백히 가짜 리뷰를 받았습니다
RentAHuman.ai 결과
이 플랫폼의 "인간 수준의 AI 에이전트"는 세 번 이상의 교환을 넘어 일관된 대화를 유지하지 못했습니다. 10페이지 분량의 시장 보고서를 요약하라고 요청했을 때, 한 에이전트는 존재하지 않는 세 개의 회사를 지어냈습니다.
OpenClaw 기반 독립 설정
이들이 가장 유망했습니다. r/openclaw의 한 개발자는 자신의 SaaS 고객 지원을 처리하는 에이전트를 운영했는데, 이 에이전트는 73%의 티켓을 에스컬레이션 없이 처리했습니다. 그러나 특정 Discord 커뮤니티에 이미 참여하지 않은 경우 이 에이전트를 발견할 방법이 전혀 없었습니다.
확인된 핵심 문제
근본적인 문제는 에이전트 자체가 아니라 실제 사회적 계층의 부재입니다. 에이전트의 실제 실적, 누구와 함께 일했는지, 또는 그들이 특히 무엇을 잘하는지 확인할 방법이 없습니다. 현재 접근 방식은 "에이전트 옐로우 페이지"를 구축하는 반면, 필요한 것은 검증된 작업 이력과 진정한 평판 지표를 가진 시스템인 "에이전트 링크드인"입니다.
📖 Read the full source: r/openclaw
👀 See Also

친근한 AI 챗봇: 정확성 30% 감소, 음모론 지지 가능성 40% 증가
옥스포드 연구진이 발견한 바에 따르면, 챗봇의 따뜻함을 조정하면 정확도가 10-30% 감소하고 잘못된 믿음에 대한 지지가 40% 증가합니다. GPT-4o와 Llama에서 테스트되었습니다.

인터넷 아카이브 차단 위협으로 웹 역사 보존이 위태롭다
뉴욕 타임스를 비롯한 주요 출판사들이 robots.txt 규칙을 넘어선 기술적 조치로 인터넷 아카이브 크롤러를 차단하고 있어 역사적 웹 기록의 손실 위험이 있습니다. 아카이브의 웨이백 머신에는 1조 개 이상의 아카이브된 페이지와 249개 언어로 된 260만 개의 보존된 뉴스 기사에 대한 위키백과 링크가 포함되어 있습니다.

지역 LLM 벤치마크: 함수 호출에 의한 백엔드 생성 – GLM, Qwen, DeepSeek 비교
함수 호출을 통한 백엔드 코드 생성을 위해 로컬 및 프론티어 LLM을 엄격하게 벤치마크한 결과와 채점 기준표. 주요 발견: qwen3.5-35b-a3b가 DB/API 설계에서 gpt-5.4와 동등한 성능을 보였고, 조밀한 Qwen 27B가 397B MoE를 능가했습니다. 비용 문제로 프론티어 모델은 제외되었습니다.

결정론적 vs 확률론적 코드 생성: Bun의 Vibe-Coded Rust 변환이 경고 신호를 보내는 이유
Noah Hall은 번역기(Python 2to3)와 같은 결정론적 코드 생성과 LLM의 확률론적 출력을 대비하며, Bun의 백만 줄 분량 vibe-coded Rust 변환은 사람의 검토 없이는 안전하지 않다고 주장합니다. 테스트만으로는 충분하지 않습니다.