Anderson, acho que uma parte do problema de gastar token rápido nas iterações não é só o modelo em si -- é o chat não ter memória permanente: a cada mensagem você reexplica o contexto do projeto (paleta, guidelines, o que já foi decidido) e isso infla o prompt a cada rodada.
Uma técnica que ajuda bastante, e funciona com qualquer ferramenta baseada em IA (Claude, Stitch, o que vier): em vez de manter tudo dentro da conversa, você cria um arquivo de contexto do projeto -- uma espécie de "constituição" do design system: paleta, tipografia, componentes já aprovados, decisões de UX que não podem mudar. Esse arquivo fica numa pasta e é referenciado no início da sessão, em vez de reescrito toda vez. A IA lê o arquivo, não o histórico inteiro do chat.
O segundo passo é separar por função: em vez de um chat genérico fazendo tudo (gerar, ajustar, revisar consistência entre telas), você monta um "agente" específico pra cada etapa -- um comando só pra gerar variações, outro só pra checar consistência. Cada um lê só o arquivo de contexto relevante, não a conversa gigante acumulada. Isso derruba boa parte da reprocessagem que está comendo seus tokens nas iterações.
Sobre o Claude e o Stitch gerarem em HTML/CSS/JS: faz sentido pro caso de uso deles, que é voltado a quem programa -- o motor por trás "programa" o layout em vez de desenhar pixel a pixel. Pra design puro sem nenhuma linha de código, ainda é bem cru mesmo.
Escrevi um livro sobre montar esse sistema de arquivo + agentes especialistas sem programar -- o link está no meu perfil.