Assistente de IA da UIUC Executa 11 Modelos em Paralelo para Respostas em Menos de 2 Segundos

O Centro de Inovação em IA da UIUC lançou um assistente de ensino de IA open-source para cursos de Engenharia Elétrica, disponível no HuggingFace Spaces. O sistema orquestra 11 modelos separados em paralelo para recuperação e geração de texto e imagem, moderação e classificação, alcançando um tempo de resposta médio de 2 segundos.
Arquitetura
O assistente usa geração aumentada por recuperação (RAG) com um banco de vetores Pinecone. As fontes de dados incluem livros didáticos, vídeos de aulas (transcritos via Whisper) e fóruns de perguntas e respostas de alunos. O código é licenciado sob MIT e está pronto para ser conectado ao seu próprio banco de dados Pinecone.
Conjunto de Dados RLHF
A equipe contratou cinco alunos de Engenharia Elétrica para produzir um conjunto de dados de comparação para RLHF, cobrindo o curso ECE 120 da UIUC. O conjunto está disponível gratuitamente no HuggingFace: kastan/rlhf-qa-comparisons.
Avaliação
Cada novo recurso aciona uma avaliação automatizada. O conjunto de dados de avaliação, escrito por engenheiros elétricos especialistas, é usado para gerar respostas de cada modelo. Em seguida, o GPT-3 julga se as respostas geradas são "melhores" ou "piores" que as respostas de referência escritas por humanos. Limitação conhecida: o GPT-3 avalia a si mesmo e tende a favorecer saídas do GPT-3.
Início Rápido
pip install -r requirements.txt
# Configure as chaves de API em run_ta_gradio.sh, depois:
bash run_ta_gradio.shConstrua seu próprio índice Pinecone usando os scripts fornecidos: livros didáticos em PDF, transcrições de vídeo do Whisper ou slides de aula em imagens .jpg.
Arquivos Principais
main.py— agregação de modelosTA_gradio_ux.py— interface Gradioprompting.py— modelos de promptevaluation.py— loop de avaliação GPT-3feedback.json— feedback coletado dos usuários
O repositório contém 146 commits, 57 estrelas e um diagrama do sistema mostrando o pipeline de modelos paralelos.
📖 Leia a fonte completa: HN LLM Tools
👀 See Also

Implementação do Agente Local OpenClaw com Cache TurboQuant para Hardware de Médio Porte
Um aplicativo de um clique para o OpenClaw com modelos locais agora roda em dispositivos de médio porte como o MacBook Air com 16GB de RAM usando cache TurboQuant e aquecimento de contexto. A implementação corrige o llama.cpp para chamadas de ferramentas confiáveis e alcança 10-15 tokens por segundo com o Gemma 4 e QWEN 3.5.

Skill Bill: Uma Estrutura de Governança Baseada em Markdown para Habilidades de Codificação em IA
Um desenvolvedor criou o Skill Bill, um framework de 44 habilidades de IA baseadas em Markdown para Kotlin, Android/KMP, PHP e Go que aborda problemas de gerenciamento de prompts como derivação de nomenclatura e lógica duplicada. Inclui habilidades de orquestração como 'feature-implement' que encadeiam 10-12 invocações de habilidades e sincroniza com Claude Code, Copilot, GLM e Codex.

Zerostack 1.0.0: Um Agente de Codificação Inspirado no Unix em Rust Puro
Zerostack é um agente de codificação escrito em Rust puro, modelado na filosofia Unix — ferramentas pequenas e combináveis conectadas via stdin/stdout.

Relay permite que sessões do Claude Code se comuniquem sem alternar entre janelas
Um plugin chamado Relay usa a capacidade de canais do Claude Code para permitir que sessões paralelas se comuniquem diretamente, eliminando a necessidade de copiar e colar manualmente o contexto entre repositórios de backend e frontend.