Cache Semântico e Memória em LLMs: Latência, Custo e Contexto que Aprende
Cache em app LLM não é opcional.
Sem ele, você paga duas vezes pela mesma resposta e castiga o usuário com latência duplicada.
Mas cache de IA tem duas caras — e confundir elas custa caro.
No artigo de hoje, artigo 3 da série LLMOps, mostro cache semântico e memória.
-
Cache exato. Hash do prompt idêntico. Perfeito para prompts determinísticos (system prompt estável, mesma pergunta). Custo zero de similaridade.
-
Cache semântico. Embedding do prompt + busca por similaridade. Responde “como faço X?” e “como eu faço pra X?” sem chamar o modelo. Threshold alto (0.95+) para não errar.
-
Prompt cache nativo. Providers cacheiam o prefixo do prompt. Separe system prompt (cacheável) da user message (variável) e economize recomputação.
-
TTL e invalidação. Cache infinito vira bug. Invalide quando mudar versão de modelo, dados ou regra de negócio.
-
Memória de conversa. Janela deslizante para contexto curto; sumarização para longo; RAG sobre conversas passadas. Sem isso, o agente esquece ou transborda contexto.
O código do artigo traz um SemanticCache com cosine similarity, função cachedCompletion() com fallback e headers de prompt cache do provider.
Na prática, cache bem feito corta 40-70% das chamadas — e reduz latência percebida para próximo de zero.
A pergunta certa não é “vamos cachear?”. É “o que cachear, por quanto tempo e com qual namespace?”.
📎 Link no primeiro comentário: https://lemon.dev.br/pt/blog/cache-semantico-memoria-llm
#LLMOps #SemanticCache #Embeddings #VectorDatabase #AIEngineering #CostOptimization #RAG