제미니 임베딩 2: 구글의 첫 번째 네이티브 멀티모달 임베딩 모델 출시

Google DeepMind이 Gemini 아키텍처 기반 최초의 완전한 멀티모달 임베딩 모델인 Gemini Embedding 2를 공개 미리보기로 출시했습니다. 기존 텍스트 전용 모델과 달리, 이 모델은 텍스트, 이미지, 비디오, 오디오, 문서를 단일 통합 임베딩 공간에 매핑하여 100개 이상의 언어에 걸친 의미적 의도를 포착합니다.
주요 기술 사양
이 모델은 Gemini API와 Vertex AI를 통해 이용 가능하며, 다음과 같은 구체적인 기능을 지원합니다:
- 텍스트: 최대 8192개의 입력 토큰 컨텍스트 지원
- 이미지: 요청당 최대 6개 이미지 처리 (PNG 및 JPEG 형식)
- 비디오: 최대 120초 분량의 비디오 입력 지원 (MP4 및 MOV 형식)
- 오디오: 텍스트 전사 없이도 오디오를 네이티브로 수집 및 임베딩
- 문서: 최대 6페이지 길이의 PDF 직접 임베딩
단일 모달리티 처리 외에도, 이 모델은 인터리브된 입력을 네이티브로 이해하여 단일 요청에 여러 모달리티(예: 이미지 + 텍스트)를 전달하여 서로 다른 미디어 유형 간의 미묘한 관계를 포착할 수 있게 합니다.
유연한 출력 차원
Gemini Embedding 2는 Matryoshka Representation Learning (MRL)을 통합하여 기본값 3072에서 축소되는 유연한 출력 차원을 가능하게 합니다. 이를 통해 개발자는 성능과 저장 비용을 균형 있게 조정할 수 있습니다. 구글은 최고 품질을 위해 3072, 1536 또는 768 차원 사용을 권장합니다.
통합 및 사용 사례
이 모델은 검색 증강 생성(RAG), 의미 검색, 감정 분석, 데이터 클러스터링을 포함한 멀티모달 다운스트림 작업을 위해 설계되었으며, 여러 플랫폼을 통해 이용 가능합니다:
- Gemini API
- Vertex AI
- LangChain, LlamaIndex, Haystack
- 벡터 데이터베이스: Weaviate, QDrant, ChromaDB, Vector Search
구글은 Gemini API 및 Vertex AI 구현을 시작하기 위한 대화형 Colab 노트북을 제공합니다.
📖 Read the full source: HN AI Agents
👀 See Also

Anthropic, 모바일 개발을 위한 Claude Code 원격 제어 기능 출시
Anthropic은 Claude Code 사용자가 모바일 기기에서 로컬 개발 세션을 제어할 수 있는 기능인 Remote Control을 출시했습니다. Claude Max 구독자를 대상으로 먼저 제공되며, 버전 2.1.52 이상이 필요하고 QR 코드를 사용하여 세션을 동기화합니다.

Claude Code v2.1.158: Opus 4.7/4.8용 Bedrock, Vertex, Foundry에서 자동 모드 출시
Claude Code v2.1.158이 Bedrock, Vertex, Foundry에서 Opus 4.7 및 4.8에 대한 자동 모드를 활성화합니다. CLAUDE_CODE_ENABLE_AUTO_MODE=1로 설정하여 사용하세요.

EFF: 트럼프 행정부, 자율 무기 작업 거부한 Anthropic에 보복
국방부가 인공지능 모델의 자율 무기 및 대규모 감시 사용을 거부한 Anthropic에 대해 보복 조치를 취한 것은 수정헌법 제1조를 위반한다는 EFF의 의견서가 제출되었습니다.

클로드 코드 v2.1.174: 휠 스크롤 가속 토글, /모델 수정, GovCloud 지원 및 VSCode 사용 속성
Claude Code v2.1.174에서는 전체 화면 모드에서 스크롤 가속을 비활성화하는 wheelScrollAccelerationEnabled 설정이 추가되었고, /model 선택기에서 Opus/Sonnet 행이 숨겨지는 문제, Bedrock GovCloud 400 오류, VSCode 사용량 귀속 분석, 백그라운드 세션 환경 상속 문제 등이 수정되었습니다.