ARQUIVO DE SINAL 03
AgentForge
- STATUS
- EM CONSTRUÇÃO
- CATEGORIA
- CÓDIGO ABERTO
VISÃO GERAL
O AgentForge responde a uma pergunta que a documentação dos frameworks não responde: como é, de fato, o mesmo agente em cada um deles? São cerca de noventa exemplos executáveis em dez frameworks — AG2, Agno, AutoGen, CrewAI, Google ADK, LangGraph, LlamaIndex, OpenAI Agents SDK, Pydantic AI e smolagents — cada exemplo isolando um conceito.
O PROBLEMA
Escolher um framework de agentes geralmente significa ler dez páginas de marketing que prometem as mesmas coisas. O que falta é a comparação chata: a mesma tarefa, as mesmas ferramentas, escritas de cada jeito, para que as diferenças estejam no código e não no discurso.
ABORDAGEM
Toda implementação retorna por um contrato compartilhado de agente (`AgentResult` e `TokenUsage`) e chama as mesmas implementações de ferramentas, que é o que impede o benchmark de favorecer discretamente o framework que ganhou as ferramentas mais bem escritas. Os resultados são gravados em JSONL e renderizados em relatórios Markdown. Os testes unitários rodam sem credenciais e sem rede, com HTTP mockado, então o repositório permanece reproduzível para quem clonar.
FUNCIONALIDADES
- Matriz de capacidades acompanhando ferramentas, streaming, memória, human-in-the-loop, multiagente, RAG, MCP, tracing e evals entre os frameworks
- Bancada de benchmark medindo latência, uso de tokens e taxa de falha em pé de igualdade
- Cada exemplo é um projeto independente, com dependências fixadas
- CI roda lint, compilação e varredura de segredos a cada mudança
STACK
Python / uv / pytest / LLMs / RAG / MCP