1

Pitch: Fiz um app de bandeja para ver a VRAM e descarregar modelos do Ollama com um clique

Uso Ollama e ComfyUI na mesma máquina (uma RX 9070 XT), e o problema era sempre o mesmo: modelo preso na memória depois de usar, VRAM cheia sem aviso e nenhum jeito rápido
de saber quem estava ocupando o quê.

O LLM Hub lê a GPU pelos contadores de desempenho do Windows, os mesmos do Gerenciador de Tarefas, então não depende do nvidia-smi e funciona em AMD e Intel. O botão de
parar fala direto com o Ollama, não com a interface, então serve para quem usa Open WebUI, outro cliente ou um app próprio. O ComfyUI é encerrado à parte, porque é o único
jeito de devolver a VRAM da geração de imagem.

Por dentro são três peças conversando em 127.0.0.1: o ícone da bandeja (pystray), o painel (pywebview com o WebView2 do Windows) e um servidor local em aiohttp. É MIT, e o
executável não tem assinatura digital, então o Windows avisa na primeira vez. Quem preferir pode gerar o executável pelo script do repositório.

Testei só em AMD; se alguém com NVIDIA puder testar, o retorno vai ajudar muito.

https://github.com/Guilhermecmt/HUB-LLM-LOCAL

Carregando publicação patrocinada...