Mesa Redonda de IA: Ferramenta para Comparar Mais de 200 Modelos de IA em Perguntas Estruturadas

AI Roundtable é uma ferramenta baseada na web que permite aos usuários comparar respostas de vários modelos de IA em perguntas estruturadas. A ferramenta foi criada após discussões sobre o post "Car Wash Test" no Hacker News.
Principais Recursos
A ferramenta oferece várias capacidades específicas:
- Configuração da Pergunta: Os usuários digitam uma pergunta e definem opções de resposta
- Seleção de Modelos: Escolha até 50 modelos por vez de um pool de mais de 200 modelos
- Condições de Teste Consistentes: Todos os modelos respondem independentemente em condições idênticas sem prompt do sistema, com saída estruturada e mesma configuração para cada modelo
- Recurso de Debate: Execute uma rodada de debate onde os modelos veem o raciocínio uns dos outros e têm a chance de mudar de ideia
- Modelo Revisor: Um modelo revisor resume a transcrição completa das respostas
- Acesso: Não requer cadastro, é gratuito para usar
- Infraestrutura: Todos os modelos são roteados via Opper (a startup do criador)
Uso Prático
Esse tipo de ferramenta é útil para desenvolvedores que trabalham com agentes de IA para comparar sistematicamente o desempenho dos modelos em perguntas ou cenários específicos. Ao fornecer condições idênticas para todos os modelos, permite comparações mais objetivas do que testes manuais. O recurso de debate permite observar como os modelos ajustam seu raciocínio quando expostos a perspectivas alternativas, o que pode ser valioso para entender o comportamento dos modelos em contextos colaborativos ou iterativos.
O criador está ativamente buscando feedback da comunidade e disponibilizou a ferramenta para uso imediato sem requisitos de registro.
📖 Read the full source: HN AI Agents
👀 See Also

Plugin OpenClaw Context Meter Mostra Porcentagem de Uso de Token do Telegram
Um novo plugin OpenClaw exibe a porcentagem de uso de tokens após cada resposta do bot do Telegram, mostrando valores como '45k / 200k (22%)' e detectando eventos de compactação. O plugin evita problemas de OOM ao codificar as janelas de contexto em vez de usar execSync.

O Relvy melhora a precisão da análise de causa raiz do Claude em 12 pontos percentuais no benchmark OpenRCA.
Relvy, uma ferramenta que automatiza runbooks, demonstrou uma melhoria de 12 pontos percentuais na precisão do Claude no benchmark OpenRCA para análise de causa raiz. Os resultados foram compartilhados por meio de uma postagem no Hacker News com 11 pontos.
Terry Tao transporta 24 applets Java para JavaScript com agente LLM — encontra erros no código original
Terence Tao usou um agente de codificação com LLM para portar seus applets Java de 1999 para JavaScript em horas. O agente encontrou dois bugs no código original e introduziu apenas um problema menor no manuseio de arrasto.

ForgeAI: Uma Bancada Visual para Engenharia de Modelos
O ForgeAI oferece uma interface visual para inspeção, fusão e treinamento de modelos, com recursos como inspeção de arquitetura de modelos 3D e M-DNA Forge para fusão visual de camadas.