3

Valeeeu, Oletros! E seu comentário levanta o ponto que mais me incomodou enquanto eu fazia isso.

Você está certo, eu só tenho uma ponta. Consigo medir o que foi publicado, votado e comentado, mas não faço ideia do que foi lido. Um post com zero voto e zero comentário pode ter sido lido por quinhentas pessoas que acharam bom e seguiram em frente. Na minha planilha ele aparece igualzinho a um post que ninguém abriu.

Isso limita bastante as conclusões. Quando eu digo que 27% dos posts nunca recebem um comentário, o que estou medindo de verdade é silêncio de participação, não ausência de leitura. São coisas diferentes e eu não consigo separar.

Sobre resgatar conteúdo antigo, seus dados batem com os meus. Fui olhar os autores que você citou:

autorpoststabcoins médiopalavras por post
@kht2018,901.581
@maniero3614,831.050
média do site4,63460

Os dois rendem três a quatro vezes a média do site, escrevendo textos duas a três vezes maiores. É a mesma relação que apareceu no post: cada faixa de tamanho paga mais que a anterior, e acima de 2 mil palavras a média chega a 10,80 tabcoins.

O que reforça seu argumento: esse tipo de conteúdo é o que menos envelhece e o que mais se perde no feed cronológico.

Inclusive eu construí exatamente o que você descreve e não publiquei ainda. É uma segunda página do painel que separa por assunto (C, Python, SQL, Git, Linux, segurança, carreira) os posts do acervo que ensinam alguma coisa, ordenados por relevância e não por data. Segurei porque achei que merece post próprio em vez de virar rodapé. Se te interessar como referência para o tabrank, te mando o código e a lógica de filtragem, que é a parte chata.

Gostei da ideia de mandar o clique de volta para cá em vez de canibalizar. E a parte de virar PR se algum formato funcionar é o caminho certo, até porque o CONTRIBUTING do repositório pede exatamente isso: expor o problema antes de propor a solução.

Sobre o acervo, claro. São 231 MB em NDJSON, uns 73 MB compactado, divididos em posts com corpo completo, árvores de comentários, perfis de autor e os comentários órfãos de publicações apagadas. Vou subir como release no repositório onde já estão os gráficos e coloco o link aqui.

Um aviso sobre os órfãos, porque me custou tempo: comentário apagado vem na árvore como nó vazio, sem autor e sem texto, só para as respostas abaixo continuarem alcançáveis. São 2.358 deles. Se contar sem filtrar, seu total infla 2%.

Carregando publicação patrocinada...
1

Meus 2 cents extendidos,

O usuario @pilati que citei eh um caso bem interessante: eh um autor que nao publica post mas interage bastante com posts (sejam posts com afirmacoes ou duvidas) e gerando conteudo relevante desta forma, so que, diferente de um post normal (que deveria gerar relevancia por si proprio), o comentario geralmente so gera relevancia diante do contexto onde foi inserido e seria positivo os mecanismos de filtragem e pesquisa levassem isso em consideracao tambem. Nao eh so o caso deste usuario em particular, mas o @maniero (entre outros) tambem tem geracao de conteudo relevante atraves de comentarios.

Enfim, eh um detalhe que lembrei de clarificar.

Quanto aos codigos que voce tenha utilizado, sem duvida tenho interesse, ate para comparar com algumas ideias que tenho usado.

Por exemplo, e como voce citou em outro comentario neste post, tambem vou usar a IA para classificar cada publicacao (ate porque eh inviavel fazer por analise individual humana), "taguear" por temas, etc.

Uma outra ideia que estou alimentando eh fazer uma modificacao na extensao TABNEWS FAVORITOS criando uma opcao (on/off) de envio para o tabrank dos posts favoritados (de forma anonima), criando assim uma base sobre o que as pessoas acham interessante marcar para leitura/referencia posterior e nao apenas como resultado de um up/down vote (que pode apenas refletir uma opiniao sobre o post e nao sobre sua utilidade a longo prazo - p.ex. dei upvote no seu comentario para voce saber que foi lido e fiquei contente com a reposta, mas nao implica que o comentario em si eh relevante para leitura daqui 6 meses).

Sobre a questao de analise de qualidade do conteudo de posts/comentarios (que voce aventou em outro comentario), gostaria de fazer um adendo: como o conteudo do TABNEWS eh criado atraves da acao voluntaria e nao remunerada dos autores, upvotes e comentarios (mesmo que um simples "valeu !!!") acabam virando moeda de incentivo para que o autor continue publicando (e se aperfeicoando), mostrando que o publico nao lhe eh indiferente, e isso me parece forca motriz para a comunidade de um modo geral - o que torna a analise um tanto quanto mais complexa.

Saude e Sucesso !


Este post foi favoritado via extensão TABNEWS FAVORITOS

Tem curiosidade sobre IA ? Da uma olhada no meu LIVRO: IA PARA ENGENHEIROS

1

Valeeeu pelo retorno, Oletros! E o @Pilati me pegou de jeito haha.

Quando você citou ele na primeira vez, eu fui procurar no acervo e não achei nada. Cheguei a escrever aqui que ele não aparecia. O problema é que eu busquei em minúscula e o campo é sensível a maiúscula, então o @Pilati com P maiúsculo estava lá o tempo todo, invisível para a minha busca. Erro bobo e dos piores, porque resultado vazio parece resposta.

Achei ele agora: 1.242 comentários, 2.654 tabcoins, nenhuma publicação. É o maior contribuidor do acervo inteiro que nunca escreveu um post.

E aí fiquei curioso e fui ver quantos são assim:

pessoas
publicam post8.352
comentam16.445
só comentam, nunca publicaram9.915

São 60% de quem comenta. E juntas elas somam 24% de todos os tabcoins já distribuídos em comentário aqui.

Isso me incomodou. Cada vez que eu escrevi "autores" no post, eu estava falando só de quem publica. Um quarto do valor gerado em comentário vem de gente que eu nem contei.

Seu ponto sobre o comentário depender do contexto também apareceu no número: comentário de primeiro nível rende 1,57 tabcoin de média, e de terceiro nível rende 1,25. O mesmo texto vale menos quanto mais fundo estiver na conversa, o que é justo para quem está respondendo mas atrapalha muito quem quer recuperar aquilo depois.

Sobre os favoritos, achei a ideia ótima, e o motivo que você deu é o mais forte de todos. Você votou no meu comentário para eu saber que foi lido, e isso não diz nada sobre ele prestar daqui a seis meses. São duas medidas diferentes que hoje o site colapsa numa só.

E é exatamente o que eu não consigo tirar dos meus dados. Eu tenho o saldo final de cada publicação, mas não sei quando os votos entraram, quem votou, nem se alguém voltou a ler depois. Uma base de favoritos anônimos capturaria algo que não existe em lugar nenhum. Se você fizer, quero muito ver.

Já o adendo da moeda de incentivo me fez pensar um tempo antes de responder. Ele complica mais do que parece.

Se um "valeu!!!" é inútil como texto mas serve de combustível para o autor voltar a publicar, então um classificador que marcar aquilo como lero-lero está certo sobre o conteúdo e errado sobre a função. E o efeito que importa, que é o cara publicar de novo, acontece depois e em outro lugar.

O que eu acho que dá para fazer é medir as duas coisas separadas, sem fingir que são a mesma. "Este texto ensina alguma coisa" é julgamento e é onde mora toda a discussão de confiar no modelo ou no humano. "Este texto fez o autor voltar" é comportamento, e comportamento eu meço com o que já tenho.

Inclusive saiu um número disso respondendo outro comentário aqui do post: quem estreia com o primeiro post enterrado volta a publicar em 15,7% dos casos, contra 50,3% de quem estreia bem. Separei por ano de estreia para descartar que fosse só falta de tempo, e o efeito aparece em todas as safras. É o seu mecanismo funcionando no sentido contrário.

Sobre o acervo, subi tudo:

https://github.com/im-fernando/tabnews-analise/releases/tag/acervo-2026-07-31

São 72 MB comprimido, 231 MB abertos, em NDJSON. Vai índice, conteúdo com o corpo completo, as árvores de comentário, os órfãos de publicações apagadas e os perfis. O código do coletor e do painel está no mesmo repositório, pode usar à vontade no tabrank.

Botei um LEIA-ME dentro do pacote com três coisas que me custaram tempo e vão te poupar. Comentário apagado vem na árvore como nó vazio, sem autor e sem texto, e são 2.358 deles, então se contar sem filtrar seu total infla 2%. Publicação apagada some da listagem mas os comentários ficam, e dá para reconstruir a conversa subindo pela cadeia de parent_id até sair do conjunto de órfãos. E o NewsletterOficial é bot e responde por 17,6% do acervo, então convém tirar antes de qualquer média.

Qualquer coisa que não fizer sentido nos dados, me chama que eu ajudo a destrinchar. Valeu demais pelos dois comentários.