Em resumo
A Composio comparou quatro frameworks de agentes usando o DeepSeek V4 Flash em 30 tarefas reais. O Claude Code foi o mais rápido e consumiu menos chamadas de ferramentas e tokens de saída, mas custou US$ 0,195 por tarefa, contra US$ 0,073 do OpenCode.
Um teste da Composio colocou quatro frameworks de agentes diante das mesmas 30 tarefas do mundo real, usando o modelo DeepSeek V4 Flash. O resultado indica que a escolha da ferramenta envolve principalmente um equilíbrio entre velocidade e custo, já que as taxas de sucesso ficaram próximas, enquanto o preço por tarefa variou de forma expressiva.
Entre os sistemas avaliados, o Claude Code apresentou o melhor desempenho em velocidade. Também usou a menor quantidade de chamadas de ferramentas e de tokens de saída, segundo o resumo da pesquisa. Ainda assim, foi o segundo colocado em custo, com US$ 0,195 por tarefa.
O OpenCode apareceu como a alternativa mais barata, a US$ 0,073 por tarefa. A diferença entre os dois valores é de aproximadamente 2,7 vezes, próxima da descrição de quase três vezes usada na reportagem original.
O que o teste mediu
A comparação não foi apresentada como uma avaliação geral de todos os usos possíveis de agentes. Ela se concentrou em quatro frameworks, um mesmo modelo e 30 tarefas consideradas reais pela Composio. Esse desenho permite observar diferenças operacionais entre as ferramentas, mas limita a extensão das conclusões para outros modelos, cargas de trabalho ou configurações.
As taxas de sucesso foram descritas como majoritariamente semelhantes. Isso sugere que, nesse conjunto específico, pagar mais não produziu uma vantagem proporcional na conclusão correta das tarefas. O resultado, porém, não informa todos os critérios de avaliação nem a distribuição detalhada dos erros.
A velocidade pode ser decisiva em fluxos interativos, nos quais o usuário acompanha o agente e precisa de respostas rápidas. Já em processos automatizados ou de grande volume, o custo unitário tende a pesar mais, especialmente quando pequenas diferenças se acumulam em centenas ou milhares de execuções.
Preço e eficiência não são a mesma coisa
O caso do Claude Code mostra que usar menos chamadas de ferramentas e gerar menos tokens não significa necessariamente ser a opção mais barata. O custo final depende também dos preços associados ao modelo e à forma como cada framework organiza sua execução, embora o material fornecido não detalhe essa composição.
Essa distinção é importante porque métricas isoladas podem levar a decisões equivocadas. Um agente que termina mais rápido pode reduzir o tempo de espera e o consumo de infraestrutura, mas ainda ter um custo direto maior. Da mesma forma, uma opção barata pode exigir mais tempo ou apresentar limitações que não aparecem em uma média simples por tarefa.
Para equipes técnicas, a comparação recomenda observar pelo menos três dimensões: taxa de sucesso, tempo de execução e custo por tarefa. O peso de cada uma depende do uso. Um protótipo pode priorizar velocidade e facilidade de desenvolvimento, enquanto uma operação recorrente pode favorecer previsibilidade e menor custo marginal.
- Claude Code: US$ 0,195 por tarefa e maior velocidade no teste.
- OpenCode: US$ 0,073 por tarefa, o menor custo informado.
- As taxas de sucesso foram consideradas majoritariamente semelhantes entre os frameworks.
- A Composio usou o DeepSeek V4 Flash em 30 tarefas reais.
O que ainda não está confirmado
O material disponível não apresenta os nomes dos outros dois frameworks, os tempos absolutos de execução, a taxa de sucesso de cada sistema nem a metodologia completa das tarefas. Também não informa se os preços consideram apenas o uso do modelo ou outros custos operacionais.
Por isso, os números devem ser lidos como o retrato de um experimento específico, e não como um ranking definitivo. Resultados podem mudar com outro modelo, tarefas diferentes, limites de contexto, ferramentas adicionais ou alterações nos preços dos provedores.
A principal implicação prática é que não há uma escolha universalmente melhor com base apenas nessa comparação. O Claude Code parece favorecer rapidez, enquanto o OpenCode oferece menor custo no conjunto analisado. A decisão final exige testar o fluxo real da equipe e medir o desempenho sob condições equivalentes.
A reportagem original, publicada pelo The Decoder, atribui os dados ao teste conduzido pela Composio. Esta matéria usa exclusivamente as informações fornecidas desse material; detalhes não incluídos no resumo permanecem sem confirmação independente.
O nosso prisma
O teste reforça que frameworks de agentes devem ser avaliados como sistemas completos, não apenas pela quantidade de tokens ou chamadas de ferramentas. A vantagem de velocidade do Claude Code pode ser valiosa em tarefas interativas, mas o custo maior reduz sua atratividade em operações de alto volume. O OpenCode se destaca economicamente no experimento, sem que isso prove superioridade em todos os cenários. A decisão mais segura é combinar benchmarks específicos, taxa de erro e custo total de operação.
Fonte: The Decoder
Perguntas frequentes
Qual framework foi o mais barato no teste?
O OpenCode, com custo médio informado de US$ 0,073 por tarefa.
O Claude Code teve melhor taxa de sucesso?
As taxas de sucesso foram descritas como majoritariamente semelhantes entre os frameworks.
Por que o Claude Code custou mais?
O material fornecido não identifica uma causa única; o resultado mostra que menor uso de chamadas e tokens não garantiu menor custo.
Receba o Jornal da IA todos os dias
As notícias de inteligência artificial que importam no Brasil — com o nosso prisma e sempre com as fontes. Grátis.






