1

O uso do Auto-Combo eh uma otima sacada, pois ele calcula custo, saude da API, latencia e ate estabilidade em tempo real para tomar a decisao.

Para maximizar a economia no seu plano, tente configurar o Auto-Combo com a estrategia cost ou eco, assim ele sempre prioriza a opcao mais barata que estiver online.

So tome cuidado ao adicionar novos modelos: o OpenCode tem um atraso e nao descobre modelos novos em tempo real nas sessoes abertas, entao lembre de forcar uma sincronizacao ou reinicia-lo quando alterar o OmniRoute.

Ha um detalhe conhecido no OmniRoute onde a selecao do Auto-Combo nao verifica previamente se a janela de contexto do modelo escolhido suporta o tamanho do seu prompt.

Como voce está balanceando tarefas para modelos menores/baratos (como o Qwen que voce mencionou), se o codigo for muito longo, ele pode rotear para um modelo de janela curta e a requisicao vai falhar.

Fora isso, como trabalha-se com chamadas de API, em teoria, nao deveria ter problemas com perda de contexto (exceto tamanho de janela) - mas dependendo de outras funcionalidades que voce ativar (como compressao) isso pode influenciar.

E de uma olhada na opcao "auto" na requisicao de modelo, que ele (deveria) criar um combo virtual ondemand.

Carregando publicação patrocinada...