Valeeeu pelo retorno, Oletros! E o @Pilati me pegou de jeito haha.
Quando você citou ele na primeira vez, eu fui procurar no acervo e não achei nada. Cheguei a escrever aqui que ele não aparecia. O problema é que eu busquei em minúscula e o campo é sensível a maiúscula, então o @Pilati com P maiúsculo estava lá o tempo todo, invisível para a minha busca. Erro bobo e dos piores, porque resultado vazio parece resposta.
Achei ele agora: 1.242 comentários, 2.654 tabcoins, nenhuma publicação. É o maior contribuidor do acervo inteiro que nunca escreveu um post.
E aí fiquei curioso e fui ver quantos são assim:
| pessoas | |
|---|---|
| publicam post | 8.352 |
| comentam | 16.445 |
| só comentam, nunca publicaram | 9.915 |
São 60% de quem comenta. E juntas elas somam 24% de todos os tabcoins já distribuídos em comentário aqui.
Isso me incomodou. Cada vez que eu escrevi "autores" no post, eu estava falando só de quem publica. Um quarto do valor gerado em comentário vem de gente que eu nem contei.
Seu ponto sobre o comentário depender do contexto também apareceu no número: comentário de primeiro nível rende 1,57 tabcoin de média, e de terceiro nível rende 1,25. O mesmo texto vale menos quanto mais fundo estiver na conversa, o que é justo para quem está respondendo mas atrapalha muito quem quer recuperar aquilo depois.
Sobre os favoritos, achei a ideia ótima, e o motivo que você deu é o mais forte de todos. Você votou no meu comentário para eu saber que foi lido, e isso não diz nada sobre ele prestar daqui a seis meses. São duas medidas diferentes que hoje o site colapsa numa só.
E é exatamente o que eu não consigo tirar dos meus dados. Eu tenho o saldo final de cada publicação, mas não sei quando os votos entraram, quem votou, nem se alguém voltou a ler depois. Uma base de favoritos anônimos capturaria algo que não existe em lugar nenhum. Se você fizer, quero muito ver.
Já o adendo da moeda de incentivo me fez pensar um tempo antes de responder. Ele complica mais do que parece.
Se um "valeu!!!" é inútil como texto mas serve de combustível para o autor voltar a publicar, então um classificador que marcar aquilo como lero-lero está certo sobre o conteúdo e errado sobre a função. E o efeito que importa, que é o cara publicar de novo, acontece depois e em outro lugar.
O que eu acho que dá para fazer é medir as duas coisas separadas, sem fingir que são a mesma. "Este texto ensina alguma coisa" é julgamento e é onde mora toda a discussão de confiar no modelo ou no humano. "Este texto fez o autor voltar" é comportamento, e comportamento eu meço com o que já tenho.
Inclusive saiu um número disso respondendo outro comentário aqui do post: quem estreia com o primeiro post enterrado volta a publicar em 15,7% dos casos, contra 50,3% de quem estreia bem. Separei por ano de estreia para descartar que fosse só falta de tempo, e o efeito aparece em todas as safras. É o seu mecanismo funcionando no sentido contrário.
Sobre o acervo, subi tudo:
https://github.com/im-fernando/tabnews-analise/releases/tag/acervo-2026-07-31
São 72 MB comprimido, 231 MB abertos, em NDJSON. Vai índice, conteúdo com o corpo completo, as árvores de comentário, os órfãos de publicações apagadas e os perfis. O código do coletor e do painel está no mesmo repositório, pode usar à vontade no tabrank.
Botei um LEIA-ME dentro do pacote com três coisas que me custaram tempo e vão te poupar. Comentário apagado vem na árvore como nó vazio, sem autor e sem texto, e são 2.358 deles, então se contar sem filtrar seu total infla 2%. Publicação apagada some da listagem mas os comentários ficam, e dá para reconstruir a conversa subindo pela cadeia de parent_id até sair do conjunto de órfãos. E o NewsletterOficial é bot e responde por 17,6% do acervo, então convém tirar antes de qualquer média.
Qualquer coisa que não fizer sentido nos dados, me chama que eu ajudo a destrinchar. Valeu demais pelos dois comentários.