UIUC AI 조교, 11개 모델 병렬 실행으로 2초 미만 응답

UIUC의 AI 혁신 센터는 전기공학 과정을 위한 오픈소스 AI 조교를 HuggingFace Spaces에 공개했습니다. 이 시스템은 텍스트/이미지 검색, 생성, 조정 및 순위 지정을 위해 11개의 개별 모델을 병렬로 오케스트레이션하여 중간 2초의 응답 시간을 달성합니다.
구조
이 조교는 Pinecone 벡터 데이터베이스를 사용한 검색 증강 생성(RAG)을 활용합니다. 데이터 소스에는 교과서, 강의 동영상(Whisper로 텍스트 변환), 학생 QA 포럼이 포함됩니다. 코드베이스는 MIT 라이선스로 제공되며 자체 Pinecone 데이터베이스에 바로 연결할 수 있습니다.
RLHF 데이터셋
팀은 5명의 전기공학 학생을 고용하여 UIUC의 ECE 120 과정을 대상으로 RLHF용 비교 데이터셋을 제작했습니다. 데이터셋은 HuggingFace에서 무료로 제공됩니다: kastan/rlhf-qa-comparisons.
평가
새로운 기능마다 자동 평가가 실행됩니다. 전문 EE 엔지니어가 작성한 평가 데이터셋을 사용해 각 모델의 답변을 생성합니다. 그런 다음 GPT-3가 생성된 답변이 인간이 작성한 정답보다 '더 좋은지' 또는 '더 나쁜지' 판단합니다. 알려진 한계: GPT-3가 자기 자신을 평가하므로 GPT-3 출력을 선호하는 경향이 있습니다.
빠른 시작
pip install -r requirements.txt
# run_ta_gradio.sh에서 API 키 설정 후:
bash run_ta_gradio.sh제공된 스크립트를 사용하여 자체 Pinecone 인덱스를 구축하세요: PDF의 교과서, Whisper의 동영상 자막, .jpg 이미지의 강의 슬라이드.
주요 파일
main.py— 모델 집계TA_gradio_ux.py— Gradio UIprompting.py— 프롬프트 템플릿evaluation.py— GPT-3 평가 루프feedback.json— 수집된 사용자 피드백
저장소에는 146개의 커밋, 57개의 별, 병렬 모델 파이프라인을 보여주는 시스템 다이어그램이 포함되어 있습니다.
📖 전체 출처 읽기: HN LLM Tools
👀 See Also

Bifrost LLM 게이트웨이: 11마이크로초 오버헤드, Go로 작성된 단일 바이너리
Bifrost는 Go로 작성된 오픈소스 LLM 프록시로, OpenAI, Anthropic, Azure, Bedrock으로 요청을 라우팅하며 요청당 11마이크로초의 오버헤드와 월 20달러 VPS에서 5,000 RPS를 처리합니다.

사용자가 제작한 Claude 코드용 PTC가 코드 작성이 아닌 분석 작업에서 40-65%의 토큰 절감 효과를 보여줍니다.
한 개발자가 Claude Code용 로컬 PTC 구현체인 Thalamus를 구축하고 79개의 실제 세션을 분석한 결과, 분석 작업에서는 40-65%의 토큰 절감 효과가 있었으나 코드 작성 작업에서는 거의 제로에 가까운 절감 효과를 보였습니다. 에이전트는 주로 도구 호출을 일괄 처리하기보다 일반적인 파이썬 계산을 위해 execute()를 사용했습니다.

OMAR: 수백 개의 AI 코딩 에이전트를 계층적으로 관리하는 오픈소스 TUI
OMAR는 터미널 기반 대시보드로, 계층적 조직에서 코딩 에이전트(Claude Code, Codex, Cursor, Opencode) 무리를 관리할 수 있습니다. tmux 기반으로 구축되었으며, 에이전트가 에이전트를 관리하는 계층 구조, 이기종 백엔드, Slack 통합을 특징으로 합니다.

의료 연구 워크플로우를 위한 9가지 무료 Claude 코드 스킬
한 영상의학 연구자가 의학 연구 워크플로우를 위한 9개의 Claude Code 스킬을 오픈소스로 공개했습니다. 이 스킬들은 문헌 검색에서 원고 작성에 이르는 대부분의 연구 작업을 다루며, PubMed 검색과 환각 방지 검증, 통계 분석 코드 생성, 출판용 그림 제작 등을 포함합니다.