Pitch: O que muda no custo de um projeto ao trocar de modelo de IA
Entrei no TabNews há pouco tempo, então esta é uma das minhas primeiras contribuições por aqui. Ainda estou conhecendo a comunidade e quero começar compartilhando algo que pode ser útil para quem coloca IA em produção.
Eu trabalho na equipe de San Jose por trás da Flatkey, uma camada de roteamento com API compatível com OpenAI. Estou deixando isso claro porque o texto também apresenta nosso produto.
Sobre este post: vou usar o DeepSeek como exemplo para mostrar como uma equipe pode avaliar e reduzir o custo do seu software. Também quero apresentar nossa plataforma. Em praticamente todo o catálogo, a Flatkey garante pelo menos 20% de desconto em relação ao preço oficial do modelo equivalente, considerando o mesmo tipo de uso. Como acabei de chegar ao TabNews, quero deixar uma pequena cortesia para a comunidade: os 50 primeiros usuários que se cadastrarem recebem US$ 5 em crédito gratuito, por ordem de chegada. Resgatar o crédito de boas-vindas.
Nas últimas semanas, os fabricantes chineses anunciaram vários modelos importantes. Em 13 de agosto, o DeepSeek V4 Pro foi lançado oficialmente em versão GA no app, na web e na API. A Z.ai lançou o GLM-5.3 em 14 de agosto; e a MiniMax lançou, também em agosto, o H3, um modelo de geração de vídeo que compete com o Seedance 2.5. Em algumas tarefas, esses modelos entregam resultados comparáveis aos nomes mais conhecidos, como GPT e Claude, por um preço menor. Todos estão disponíveis no catálogo de modelos da Flatkey.
Para desenvolvedores independentes, geeks e equipes pequenas, a Flatkey pode ser uma opção prática: uma chave e um saldo para mais de 100 modelos oficiais e mais de 1.000 ferramentas cobradas por uso, com menos contas e integrações para manter.
O preço do token conta, mas não conta sozinho
Uma tabela de preços normalmente mostra entrada e saída. O orçamento real também absorve chamadas que falham, respostas que precisam ser refeitas, prompts maiores do que o necessário e horas gastas mantendo integrações diferentes.
Por isso, gosto mais de medir o custo por tarefa aprovada: tokens consumidos, repetições, fallbacks e custo operacional divididos pelo número de tarefas que realmente entraram no produto.
Um modelo barato pode sair caro se a resposta exigir três tentativas. Um modelo mais forte pode compensar o preço quando resolve a tarefa de primeira. A única forma de saber é medir no seu fluxo.
O que a DeepSeek publicou sobre o V4
Eu conferi o changelog e a página de preços oficiais antes de escrever isto:
- Em 24 de abril, V4 Pro e V4 Flash apareceram na API como preview.
- Em 31 de julho, a DeepSeek publicou o
DeepSeek-V4-Flash-0731. A própria documentação ainda o chama de public beta. - Em 13 de agosto, o
DeepSeek-V4-Pro-0813chegou a GA no app, na web e na API.
Os IDs públicos são deepseek-v4-pro e deepseek-v4-flash. A documentação informa contexto de até 1 milhão de tokens, saída máxima de 384 mil tokens, tool calls, JSON output, Responses API e compatibilidade com a API da Anthropic. São especificações do fornecedor. A qualidade no seu caso precisa ser testada por você.
Como eu dividiria as tarefas
Não mandaria tudo para o mesmo modelo. Uma aplicação costuma ficar mais barata quando usa um modelo econômico para tarefas repetitivas, reserva o Pro para código e raciocínio mais difíceis e mantém um fallback para os casos em que a primeira chamada falha.
Também separaria as chaves por projeto ou ambiente. Assim fica possível responder uma pergunta que quase sempre aparece tarde demais: qual funcionalidade está consumindo o orçamento?
O teste leva poucas mudanças
Quem já usa o SDK da OpenAI não precisa reescrever a integração. Basta trocar o endpoint, a chave e o ID do modelo; a equipe pode então comparar o V4 Pro com o modelo que já usa no próprio fluxo de produção. A Flatkey verifica os endpoints oficiais a cada hora e tem failover entre canais, duas coisas que eu colocaria no mesmo teste de custo.
Outro detalhe de cobrança: chamadas que falham do lado da Flatkey não consomem saldo. Isso não elimina retries causados pelo seu próprio código ou pelo provedor, mas evita pagar por um erro na camada de roteamento.
Quero ouvir quem já colocou IA em produção
Qual tarefa vocês testariam primeiro no V4 Pro: código, agentes, suporte ou extração de dados?
Vocês acompanham apenas tokens ou sabem quanto custa cada tarefa concluída?
E o que uma camada entre a aplicação e o provedor precisa mostrar para vocês confiarem nela em produção?
Quem quiser testar pode usar a página da API DeepSeek da Flatkey. A Flatkey também oferece um programa de convites para que outras pessoas possam receber créditos. Se encontrar uma diferença entre a documentação, o preço exibido e o comportamento da API, prefiro que aponte nos comentários.
Fontes oficiais: changelog da DeepSeek, preview do V4 e modelos e preços.