Autor aqui.
Eu uso o Burnless todos os dias, e acho que ele é realmente útil. E o mais impressionante é que o LLM aprende a usá-lo instantaneamente. É muito interessante ver como a IA pensa quando está delegando ou decidindo sobre o /clear para nos ajudar.
Ontem, em um dia de trabalho real completo, eu usei 1,44M de tokens. Mas no contexto, apenas 1.590 tokens. Isso é 908x menos de contexto. E o contexto pode sobreviver a qualquer /clear.
Não estou alegando que o Burnless pegou exatamente os mesmos 1,4M de tokens de texto e comprimiu em 1.590 tokens. O que realmente aconteceu foi que todo aquele trabalho foi feito, registrado, verificado e continuado sem que o histórico acumulado permanecesse dentro do contexto ativo.
Para reproduzir com sua própria chave: python bench/run.py --turns 10
Postei aqui para receber críticas técnicas de pessoas que usam sessões longas de LLMs ou agentes.