1

Pitch: o que aprendi construindo memória persistente para um assistente de IA self-hosted

Passei os últimos meses construindo um assistente de IA pessoal que roda no VPS do próprio usuário (Debian + systemd, ~US$ 6/mês) e é usado pelo Telegram. Deixo claro logo no início: é um produto comercial meu, então leiam como relato de quem tem interesse na coisa — o que quero compartilhar aqui são as decisões técnicas, não a venda.

O problema que ninguém resolve direito

A parte difícil de um assistente não é a chamada ao modelo. É a memória.

A abordagem padrão é guardar tudo num arquivo de notas achatado e mandar de volta pro modelo. Isso funciona até parar de funcionar — e quebra silenciosamente. O assistente afirma com confiança algo que "meio que lembrou" de uma nota velha nunca verificada, ou não traz de volta uma correção que você deu três semanas atrás porque ela estava numa lista plana competindo com todo o resto.

O que acabamos fazendo

Memória tipada em SQLite local, em quatro camadas separadas:

  • claims — fatos sobre a pessoa (quem ela é, o que importa pra ela)
  • journal — o que aconteceu, com data
  • lessons — correções: onde o assistente errou e foi corrigido
  • worldview — conclusões que ele mesmo derivou ao longo do tempo

Cada camada responde a uma pergunta diferente. Quando você pergunta "o que você aprendeu sobre mim esse mês", ele lê lessons; "o que aconteceu" → journal. Um grafo tipado não só guarda melhor — ele raciocina melhor, porque sabe o tipo de cada pedaço de conhecimento.

Por cima disso, o histórico completo das conversas fica num banco separado, com busca full-text (FTS5) e busca vetorial por significado. É por isso que ele consegue citar literalmente uma conversa de três meses atrás.

A parte honesta que costumam esconder

A inferência ainda é uma chamada de API pro provedor do modelo. Então "self-hosted" aqui significa que os seus dados, a memória, o agendamento e as automações ficam na sua máquina — não que os pesos do modelo rodam localmente. Quem promete rodar um modelo de ponta num VPS de US$ 6 está mentindo, e sua audiência ia perceber na hora.

O que muda de verdade: quando a memória é uma feature de produto de terceiro, o tempo de vida dela é uma decisão de negócio, não de engenharia. Políticas de retenção mudam. No seu servidor, isso é problema seu — e só seu.

Onde NÃO compensa

Se você usa IA esporadicamente, não compensa. Escrevemos o caso contra a nossa própria solução aqui: is self-hosting AI worth it — inclusive a conta real de custo mensal.

Um panorama mais completo das vantagens (e dos limites) está em self-hosted AI benefits.

O projeto em si: avelina.ai

Curiosidade de quem já passou por isso: como vocês lidam com memória que cresce sem parar? A gente descobriu na marra que memória que só acumula e nunca esquece vira um bug por conta própria.

Carregando publicação patrocinada...