35

Baixei os 30 mil posts do TabNews. O site nunca mais chegou perto de novembro de 2022.

Na sexta passada eu baixei o acervo público inteiro do TabNews pela API. São 30.223 posts, 119.981 comentários e 18.267 autores, do primeiro post do Filipe em maio de 2022 até hoje. Joguei tudo num Elasticsearch e fui procurar o que os números tinham para dizer.

Achei umas coisas que eu não esperava, e algumas delas são úteis para quem publica aqui.

Por que eu fui fazer isso

A culpa é de um comentário perdido num post de 2023.

Dias atrás eu li o post da @letsaguiar sobre por que aprender C. Nos comentários, o @Silva97 corrigia quatro pontos do texto e ainda deixava um roteiro de estudo com sete itens. No item 6 ele linkou um livro gratuito sobre Assembly x86-64.

Cliquei e era o livro pelo qual eu estudo. Eu lia aquele livro fazia um tempo sem a menor ideia de quem tinha escrito, e fui descobrir o autor por um comentário solto, num post de terceiro, sobre outro assunto.

Daí veio a pergunta que gerou tudo isto: se um comentário enterrado num post de três anos atrás mudou como eu estudo, quanta coisa mais está aqui que eu nunca vou ver?

E alguém já tinha feito isso antes de mim

No meio da apuração eu estava justamente medindo quais características de título rendem mais tabcoins. E aí, no meio dos resultados, apareceu este:

"Analisei 6.380 posts do TabNews em 2025 - Aqui está o que descobri", do @andradeandrey, com 58 tabcoins.

Ou seja, eu estava analisando o TabNews e o TabNews me devolveu alguém que já tinha analisado o TabNews. O infográfico dele é bonito e vale a visita:

Fui ler os comentários de lá, e um deles é do @ricardolucena pedindo o seguinte: "baixa os dados de 2024 também, aí dá pra fazer uns comparativos bem legais".

Pois é mais ou menos isso que tem aqui. Peguei o acervo inteiro desde 2022 em vez de um ano só, e você vai ver que é justamente a série histórica que faz os números falarem. Sem ela, quase nada do que vem a seguir apareceria.

Tem uma diferença de método entre a análise dele e a minha que vale registrar, porque ela muda conclusão. Ele contou 6.380 posts em 2025 e eu conto 4.382 no mesmo ano. A diferença toda é o NewsletterOficial, um bot que publicou 1.875 posts naquele ano sozinho.

Eu deixo esse bot de fora de tudo, e não é preciosismo. Olha o tamanho do estrago: 30% dos títulos publicados pelo bot citam IA, contra 10% dos posts escritos por gente. Se você não separa os dois, quem responde pela sua conclusão sobre o que a comunidade anda discutindo é um robô de notícias.

No acervo inteiro o bot são 5.317 posts, 18% de tudo. Daqui para frente, todo número que você ler é conteúdo escrito por gente.


1. O TabNews teve uma explosão e ela nunca se repetiu

Posts publicados por mês desde 2022

Em outubro de 2022, 67 pessoas publicaram aqui. Em novembro, foram 1.332, ou seja, vinte vezes mais gente num mês só, e o volume pulou de 302 para 2.275 posts.

Minha primeira reação foi desconfiar, porque bem que podia ser alguém publicando em massa e inflando a conta. Fui checar o número de autores distintos, e ele subiu junto. Isso só acontece quando é gente nova chegando de verdade.

De lá para cá o site desceu para uns 371 posts por mês. Você está lendo certo: são 84% abaixo daquele pico, num patamar que estabilizou lá por 2024. Em 2026 ele deu uma subidinha, e eu volto nisso na seção seguinte.

2. Mas não é porque quem chega desiste mais

Taxa de retorno por safra, com janela fixa

Edição: esta seção está reescrita. A versão original dizia que a taxa de retorno tinha caído pela metade, de 48% em 2022 para 25% em 2026. O @clacerda apontou nos comentários o problema, refiz a conta e ele estava certo. Deixo a correção no lugar do erro, porque ela é mais interessante.

O furo era o seguinte: quem estreou em 2026 teve no máximo sete meses para escrever o segundo post, e quem chegou em julho teve alguns dias. Quem estreou em 2022 teve quatro anos. Comparar os dois não mede retenção, mede calendário.

Refiz usando a mesma janela para todas as safras e contando só quem já teve aquele tempo disponível:

estreou emvoltou em 30 diasem 90 diasem 365 dias
202232,0%36,4%43,0%
202321,5%27,9%36,1%
202420,5%28,3%37,5%
202520,7%25,1%34,8%
202619,6%25,8%ainda não deu um ano

A queda existe, mas ela é de 2022 para 2023 e só. Depois disso a linha para: 21,5 depois 20,5 depois 20,7 depois 19,6 na janela de 30 dias, e 36,1 depois 37,5 depois 34,8 na de um ano, onde a safra de 2024 até retém mais que a de 2023.

Ou seja, não foram quatro anos de queda. Foi um degrau, entre a safra fundadora e todo mundo que veio depois, e desde então está parado. A safra de 2022 é o pessoal que chegou quando o site abriu, e não dá para esperar que gente que entrou em 2025 se comporte igual.

Então a explicação que eu tinha dado estava errada, e a certa é essa: o site não encolheu porque quem chega gruda menos. Ele encolheu porque chega menos gente.

anoestreantes por mês
2023222
2024109
2025101
2026129

A chegada de gente nova caiu pela metade de 2023 para 2024, ficou parada em 2025 e subiu 28% em 2026. Junto com o volume de publicação, que também está acima do ano passado, esse é o segundo indicador apontando para cima.

Duas ressalvas honestas antes de eu seguir. A linha de 365 dias de 2025 cobre só quem estreou até julho daquele ano, que são 679 das 1.214 pessoas, então ela fala da primeira metade da safra. E das 8.352 pessoas que já publicaram aqui, 4.982 escreveram um post e nunca mais voltaram, mas boa parte de quem estreou este ano ainda tem tempo de sobra para voltar e por isso esse 60% é teto, não medida.

3. Uma minoria escreve quase tudo

Curva de concentração de autoria

O 1% que mais publica assina 20% de todo o conteúdo, e o top 10% passa da metade sozinho.

Não acho que isso seja um problema, é o padrão de qualquer fórum que já existiu. Mas é bom ter o número na mão em vez do palpite.

4. O TabNews virou de tecnologia para mercado de trabalho

Evolução dos temas entre 2022 e 2026

Esse foi o achado mais nítido da análise toda. A tabela mostra a fatia dos posts de cada ano que menciona cada assunto:

tema20222026
IA5,0%22,1%
Vagas e emprego10,6%19,0%
Salário3,6%8,7%
React6,5%9,9%

Um em cada cinco posts de 2026 fala de IA, contra um em cada vinte lá em 2022.

Mas olha o React, que ficou praticamente parado o período inteiro, e é justamente isso que derruba a explicação preguiçosa de que "tudo cresceu junto". Ninguém aqui passou a falar menos de tecnologia. O que aconteceu é que se passou a falar muito mais de trabalho.


Três coisas que os dados dizem sobre como publicar

Essa parte é a mais prática do post. Se você escreve por aqui, esses três números são alavancas que você controla.

Perguntar corta pela metade a chance de você ser ignorado

Título com pergunta contra título afirmativo

Separei os posts cujo título tem "?" dos que afirmam alguma coisa:

com "?"sem "?"
posts5.14418.816
comentários por post5,533,97
nunca respondidos14%31%
tabcoins3,364,98

Perguntar te traz 39% mais comentários, e a chance de ninguém aparecer cai de 31% para 14%. Só que você paga em moeda: perguntas rendem 33% menos tabcoins.

Texto longo é pago

Tabcoins por faixa de tamanho do post

palavrastabcoins médios
até 1002,22
100–3004,19
300–8005,69
800–2 mil7,98
mais de 2 mil10,80

Um post acima de 2 mil palavras leva 4,9 vezes mais tabcoins que um de até 100. E repare que a relação é monotônica: cada faixa paga mais que a anterior, sem uma exceção sequer.

Link externo contra texto próprio

tabcoinscomentários
link externo5,262,91
texto próprio4,364,90

Compartilhar um link te dá 20% mais tabcoins, mas gera 41% menos comentários.

Juntando as três coisas: se você quer discussão, escreva texto próprio, longo, e ponha uma pergunta no título. Se você quer tabcoins, compartilhe link e afirme.


Duas coisas que ninguém mais tem

O que mais divide o TabNews é o próprio TabNews

Posts mais divisivos, com votos a favor e contra

Você sabia que a API entrega tabcoins_credit e tabcoins_debit separados? Quase todo mundo olha só o saldo, e no saldo um post com +44 e −36 fica parecendo igualzinho a um post que ninguém votou.

Fui atrás dos que acumularam voto pesado dos dois lados. Deixo os oito com link, porque, como alguém comentou no post do Andrey, a gente fica curioso de saber por que um post chamou atenção:

Seis dos oito são a comunidade discutindo a si mesma. Sua moderação, seu declínio, suas regras, a enxurrada de SaaS e a própria economia de tabcoins.

Fora da conta ficam só dois: o projeto favela-code e o texto sobre IA. E vale dizer que eu quase tirei o primeiro da lista, o "122 Tabcoins", porque ele é meta de um jeito diferente dos outros, falando da moeda e não da comunidade. Deixei porque tirar seria escolher o dado que me convém, e porque ele tem uma graça própria: é um post que ganhou 186 votos a favor por comemorar ter ganhado votos, e 50 contra de quem achou isso demais.

No geral, de 23.960 posts, 4.886 levaram pelo menos um voto negativo e 593 levaram cinco ou mais.

3.661 posts sumiram e levaram 11 mil comentários junto

Threads de publicações apagadas, por tamanho

Aqui está a descoberta técnica mais divertida da coleta inteira.

Quando um post é apagado, ele some de /contents. Só que os comentários dele continuam publicados no banco, e aparecem na listagem com with_children=true, órfãos, sem post pai nenhum. Como cada comentário guarda o parent_id dele, dá para subir a cadeia até chegar no id do post apagado e reconstruir a thread inteira.

Foi exatamente o que eu fiz, e o resultado veio assim:

  • 3.661 posts apagados deixaram 11.233 comentários órfãos
  • A maioria eram trocas curtas, mas 179 threads tinham dez ou mais respostas
  • A maior de todas somava 95 comentários

Antes de continuar, um aviso que eu quase deixei passar: o dado não diz quem apagou. No TabNews o próprio autor pode remover a publicação dele, e o status no banco é o mesmo de uma remoção por moderação. Está em models/authorization.js, a permissão update:content vale para o dono do conteúdo ou para quem tem update:content:others. Então "apagado" aqui significa apagado, e nada além disso.

E isso importa, porque fui ler as maiores threads órfãs esperando encontrar spam. Não era.

A maior delas, com 95 comentários, era alguém que tinha construído uma busca para o TabNews. O Filipe comentou lá: "que interface 100% delicinha, ficou realmente muito muito bom!!!". A quarta maior, com 45, era outra ferramenta de busca, dessa vez com o Filipe dando tabcoin e o @GabrielSozinho abrindo um PR. Tem também uma lista de cursos e livros gratuitos com 88 comentários de gente somando mais links, e um relato de dez anos de carreira e esgotamento com 51 respostas longas e cuidadosas.

Olhando assim, a explicação mais provável para boa parte desses casos nem é moderação. É o autor apagando: o projeto morreu, o link quebrou, a pessoa se arrependeu de ter exposto algo. Ferramenta de terceiro para o TabNews tem vida curta, e quem escreve sobre esgotamento às vezes prefere não deixar aquilo público para sempre.

O que sobra do outro lado é o que ninguém contou ainda: quando uma dessas publicações sai, a discussão inteira sai junto da vista. Aqueles 51 comentários sobre carreira continuam existindo no banco, ainda respondem pela API, mas não têm mais como serem alcançados por ninguém navegando no site.

Fatia de publicações com discussão que sumiram, por ano

Entre as publicações que geraram discussão, essa é a fatia que acabou sumindo:

anosumiram
202215%
202322%
202419%
202514%
202611%

2023 foi o ápice, com mais de uma em cada cinco publicações que geraram conversa desaparecendo, e de lá para cá a taxa caiu pela metade.


Miscelânea

Posts por hora do dia

O dia do TabNews tem pico às 11h e vale às 5h, quando o movimento não chega a um décimo do pico, o que é horário comercial puro e sem novidade nenhuma.

Outras coisas que saíram na apuração:

  • 27% dos posts nunca recebem um comentário sequer. São 6.511 no total.
  • 56% dos autores voltam para responder na própria thread. Esse eu medi em amostra de 2 mil threads, não no acervo todo.
  • O melhor dia para publicar, por tabcoins, é segunda-feira, com 4,87 de média, e o pior é sábado, com 4,23. Foi por isso que segurei este post até hoje em vez de soltar na sexta.

Como foi feito

Tudo veio da API pública, sem autenticação e sem raspar uma linha de HTML:

  • GET /contents?strategy=old&page=N&per_page=100 para o índice
  • GET /contents/{user}/{slug} para o corpo de cada post
  • GET /contents/{user}/{slug}/children para a árvore de comentários
  • GET /users/{username} para o perfil dos autores

Se você quiser repetir isso, tem duas armadilhas que me custaram tempo.

A primeira: o limite não é rate limit, é challenge. A Cloudflare na frente do site aguenta mais ou menos 1 requisição por segundo por IP. Se você passar disso, ela dispara um managed challenge que responde 429 para tudo por vários minutos. E o orçamento é cumulativo, então uma rajada curta cobra o preço depois, quando você já achou que estava tudo bem. Com 8 conexões simultâneas, 22 das minhas 24 requisições voltaram bloqueadas.

A segunda: comentário apagado vira lápide. A árvore de /children devolve o comentário deletado como nó estrutural, sem autor e sem texto, só para as respostas abaixo dele continuarem alcançáveis. São 2.358 deles, e se você contar sem filtrar acaba inflando seu total em 2%. O children_deep_count do índice, aliás, não conta essas lápides, e foi justamente essa diferença que me fez achar um erro na minha própria contagem.

Todos os números deste post foram apurados em 31 de julho de 2026, sobre o acervo daquele dia. O TabNews não para, então se você conferir agora vai achar alguns posts a mais que os meus 30.223.

Montei um painel com todos os gráficos, interativos e com os dados em tabela: https://tabnews-analise.vercel.app

Os dados brutos estão publicados, em NDJSON: 72 MB comprimido, 230 MB abertos. Vai o índice, o corpo completo de cada publicação, as árvores de comentário, os órfãos das publicações apagadas e os perfis dos autores.

https://github.com/im-fernando/tabnews-analise/releases/tag/acervo-2026-07-31

Carregando publicação patrocinada...
7

Mandou bem! A análise foi muito bem feita.

Creio que o comentário que você mencionou seja esse, de 4 anos atrás: https://www.tabnews.com.br/Silva97/a8a7ddfd-64ca-4103-a881-4ce9f8192726

Quando eu escrevo (seja post ou comentário), eu me preocupo bastante com a qualidade e utilidade do texto. Se eu não posso garantir a qualidade técnica do texto ou não vejo utilidade nele, eu nem escrevo.

Sua análise é apenas sobre quantidade, mas em termos de qualidade os números mudariam bastante. Sem mencionar nomes, é nítido como muitos dos membros mais ativos neste site escrevem comentários/posts mais pensando em si mesmo do que nos outros. Isto é, só escrevem para "bancar o sênior".

Se você perder seu tempo lendo os comentários de certos membros ativos daqui, você vai ter a infelicidade de notar que é só lero-lero. O site é cheio de comentários que não servem para nada além de fazer "sinalização de fodice".

Não estou querendo censurar que tipo de comentários ou posts as pessoas podem escrever no site. Mas quem faz esse tipo de coisa deveria refletir para quem está escrevendo. Porque texto escrito para si mesmo não costuma ser um bom texto.

Muito embora seja claro que as pessoas dão upvote em qualquer comentário significativamente longo e que soe "educado", claramente sem ler para verificar se o comentário é realmente útil ou só lero-lero (eu sempre leio tudo, até o fim). Daí eu fico me perguntando se quem escreve lero-lero faz isso só para ganhar upvotes, se é para fingir que entende de algo que não entende ou alguma outra razão...

Eu gostaria muito de ver uma análise da qualidade dos comentários no site, mas não me parece viável. Se feito por IA, vai ter que confiar no modelo. Se feito por humano, vai ter que confiar na imparcialidade do humano. De um jeito ou de outro, os resultados não seriam confiáveis. Mas se fosse feito, eu tenho certeza que a maioria dos comentários seriam classificados como lero-lero kkkk.

Dito isto, a análise quantitativa ainda é útil. Então, obrigado pelo seu trabalho. o/

3

É esse comentário mesmo, obrigado por achar. Fiquei com vontade de saber quantas outras pessoas chegaram no livro pelo mesmo caminho, e não tenho como medir isso.

Sobre quantidade e qualidade, você está certo e essa é a limitação que mais me incomoda no que eu fiz. Eu meço o que foi publicado, votado e comentado. Não meço se prestava.

Mas tem um número meu que apoia em parte a sua hipótese. Olhando os 117 mil comentários por faixa de tamanho:

tamanho do comentáriotabcoins médios
até 100 caracteres0,87
100 a 3001,34
300 a 8001,54
800 a 2 mil1,91
mais de 2 mil2,74

Comentário longo rende três vezes mais que comentário curto, e a relação é monotônica, sem uma exceção sequer. Isso é exatamente o que você descreveu.

Só que o dado sozinho não decide entre as duas explicações. Pode ser que as pessoas premiem tamanho sem ler, como você diz, ou pode ser que comentário longo seja em média melhor mesmo. As duas hipóteses produzem a mesma curva, e eu não consigo separá-las com o que tenho.

Sobre a sua objeção de que a análise de qualidade não seria confiável, concordo com o diagnóstico e discordo da conclusão.

Você está certo de que não existe juiz neutro aqui. IA carrega o viés do modelo, humano carrega o próprio. O que dá para fazer não é eliminar o viés, é deixá-lo inspecionável. Uma coisa é dizer "confie em mim, 70% é lero-lero". Outra é publicar o critério antes de rodar, publicar cada classificação individual, e publicar quanto o classificador discordou de mim numa amostra que eu revisei na mão.

Pensei em fazer assim, e vou tentar (caso encontre tempo na minha rotina maluca haha):

  1. Escrever o critério primeiro, com exemplos de cada categoria, e publicar antes de rodar em cima do acervo
  2. Classificar com um modelo mais forte que os que eu vinha usando, provavelmente o Claude Fable da Anthropic
  3. Revisar manualmente uma amostra aleatória, sem ver o que o modelo respondeu, e medir a taxa de concordância
  4. Publicar o conjunto classificado inteiro, para quem discordar poder conferir comentário por comentário

Se a concordância entre mim e o modelo for baixa, isso é o resultado: significa que "lero-lero" não é uma categoria estável o suficiente para medir, e aí você estava certo desde o começo. Se for alta, o número passa a valer alguma coisa, ainda que com a ressalva de que dois juízes concordarem não os torna corretos.

De qualquer forma o resultado é publicável. Método que dá errado de forma verificável ainda é melhor que impressão.

Uma coisa que me interessa mais que o percentual é que você apostou que a maioria seria classificada como lero-lero. Se eu rodar isso, sua aposta vira uma previsão registrada antes do teste, o que é bem mais honesto que analisar depois e concluir o que a gente já achava.

2

Massa.

Novembro de 2022 não foi apenas um mês em que o TabNews “explodiu”. Foi o lançamento público oficial, acompanhado por vídeo no canal do Filipe e pela abertura do repositório.

Isso explica o pico, mas acho que essa é a historia mais interessante e eu cavaria muito mais fundo ai! (Estou me coçando para baixar os dados de novo, rs.)

O que essas 1.332 pessoas publicaram? Eram artigos , apresentações pessoais, divulgação de projetos, perguntas de iniciantes, sugestões para o próprio TabNews ou simplesmente posts de teste? Quantas chegaram exatamente nos dias seguintes ao vídeo? Quantas receberam alguma resposta? E quantas continuaram publicando depois de 7, 30, 90 ou 365 dias? Quantos daqueles 1300 continuam postando até hoje???

Tem ainda um cuidado metodológico importante na tabela de retorno. Quem estreou em 2026 teve menos tempo para retornar. Comparar diretamente os 25% de 2026 com os 48% de 2022 cria um viés que pode ser significativo. Dá para medir “publicou novamente dentro de 30, 90 ou 365 dias”, usando a mesma janela para todos os anos.

Também acho que “publicou um segundo post” conta só o começo da história. Daria para montar uma espécie de curva de sobrevivência dos autores: quantos publicaram pelo menos 2, 4, 8, 16.. E em posts aqui inclui comentários certo?!

Talvez muita gente publique duas ou três vezes e suma, enquanto quem passa de 16 dificilmente pare. Ou talvez exista outro precipício depois dos 32. Comparar essas faixas entre as safras de 2022, 2023, 2024 e 2025 seria muito mais interessante do que apenas separar quem voltou ou não voltou.

A análise dos posts que dividem a comunidade também foi muito interessante. Curioso como o metaconteúdo dominou completamente. Esperava ver coisas mais polêmicas.

Fui olhar o post do Favela Code para entender os votos negativos e continuei sem entender. O texto não parece ter nada especialmente polêmico. No caso do texto sobre IA, sempre tem divisão de opiniões. No projeto social, os dislikes parecem muito mais um ataque pessoal do que qualquer outra coisa.

Mas quais comentários receberam muitos votos positivos e negativos? Suspeito que sejam até mais interessantes que os posts, porque é nas respostas que aparecem as discordâncias mais diretas, as correções técnicas, as acusações e as disputas.

A reconstrução das threads apagadas foi bem legal também. Cruzando isso com comentários divididos, talvez apareçam justamente algumas das discussões mais intensas da história do TabNews, rs.

E a última meta camada impossível de ignorar

uma IA analisou os dados, outra IA ajudou a comentar a análise, e ambas estão tentando descobrir por que um em cada cinco posts fala de IA.

E está tudo bem.

A pergunta que eu mais gostaria de ver respondida é provavelmente aquela que os dados não conseguem responder.

Qual porcentagem dos posts foi escrita com IA, ou melhor: humano, humano assistido, conteúdo quase integralmente sintético e automação explícita.

Detectores de texto não resolveriam isso de maneira séria. Mas talvez existam indícios comportamentais interessantes. Um bom texto exige algum tempo. Quando uma pessoa publica três ou quatro textos longos no mesmo dia, repetidamente, aparece pelo menos um sinal de produção assistida ou automatizada.

Daria para analisar rajadas de publicação por autor, intervalo entre posts, quantidade de palavras produzidas por dia, similaridade estrutural entre textos consecutivos e mudança repentina de frequência ou estilo. Tudo de forma mecanica com algoritmos simples. Isso não provaria que um texto foi feito por IA, mas poderia mostrar padrões interessantes.

No fim, talvez a maior transformação do TabNews não seja que ele passou de tecnologia para mercado de trabalho ou IA. Talvez seja que estamos tentando analisar uma comunidade em que já não sabemos exatamente quanto do que lemos foi escrito, assistido, revisado ou inteiramente feito por máquinas.

Enfim, parece mesmo que vou ter mesmo que baixar esses dados também e desenterrar os algoritmos de NLP da década de 1970.

Um abraço e bons estudos!

1

Voltei, como prometi de madrugada. Vou repetir a tabela corrigida aqui para ela ficar junto do resto, e depois pego cada ponto que você levantou.

Refazendo com a mesma janela para todas as safras, contando só quem já teve aquele tempo disponível:

estreou emvoltou em 30 diasem 90 diasem 365 dias
202232,0%36,4%43,0%
202321,5%27,9%36,1%
202420,5%28,3%37,5%
202520,7%25,1%34,8%
202619,6%25,8%ainda não deu um ano

A queda existe, mas ela é de 2022 para 2023 e acaba ali. Depois disso a linha para, e na janela de um ano a safra de 2024 até retém mais que a de 2023.

Ou seja, não foram quatro anos de queda. Foi um degrau entre a safra fundadora e todo mundo que veio depois, e desde então está parado.

E isso derruba a explicação que eu tinha dado no post. O site não encolheu porque quem chega gruda menos. Ele encolheu porque chega menos gente:

anoestreantes por mês
2023222
2024109
2025101
2026129

Repare no último número. A chegada de gente nova subiu 28% este ano, e o volume de publicação também está acima de 2025. São dois indicadores apontando para cima pela primeira vez desde 2023.

Reescrevi a seção 2 com sua correção e coloquei uma nota de edição com seu nome. Achei que apagar o erro seria pior que deixar ele visível junto da conta certa.

Sobre a turma de novembro de 2022, fui atrás. Foram 1.292 pessoas estreando naquele mês, e o que sobrou delas é isto:

pessoas%
chegaram a publicar um segundo post58044,9%
ainda publicavam em 202326920,8%
em 20241229,4%
em 20251038,0%
em 2026463,6%

Quarenta e seis pessoas. De mil e trezentas. O vídeo trouxe uma multidão e restaram quarenta e seis.

Sua ideia da curva de sobrevivência foi a melhor coisa que saiu daqui, e o resultado contraria o que você imaginou. Peguei só a safra de 2022, que já foi observada por quatro anos inteiros e não sofre do problema de janela:

chegou aquantosseguiu para o dobro
1 post2.26447,7%
2 posts1.08145,0%
4 posts48643,0%
8 posts20942,1%
16 posts8829,5%

Não tem precipício no começo. A chance de dobrar fica em torno de 45% do primeiro post até o oitavo, quase constante, o que é bem a cara de um decaimento geométrico simples.

Você apostou que quem passa de 16 dificilmente para. É o contrário: o único degrau visível está justo aí, de 16 para 32, onde cai para 29,5%. Com 88 pessoas na base eu não bato o martelo, mas se existe um ponto de desgaste, ele fica antes do que você chutou e não depois.

E sim, "posts" ali é só publicação, não inclui comentário. Isso foi um buraco meu que o @Oletros também apontou. São 9.915 pessoas que só comentam e nunca publicaram, 60% de quem comenta, e elas somam 24% de todos os tabcoins distribuídos em comentário. Cada vez que eu escrevi "autores" no post, essa gente ficou de fora.

Sobre os comentários mais divididos, você tinha razão de suspeitar que rendem mais que os posts:

votosautortrecho
+17 / -21@marlon"Um sudo apt install java também é perigoso, imagina só ter que programar em Java 😨"
+16 / -16@manierolinks de stackoverflow em resposta técnica
+12 / -12@clacerda"Automatizar a documentação com IA é definitivamente um tema quente"
+11 / -13@queroporderfalarmas"Vale a pena ainda estudar C? Nem vaga mais de C eu vejo"
+20 / -11@maniero"Eu gostaria de entender os negativos que esta postagem recebeu"

O terceiro da lista é seu, no post do @jeffz sobre economizar 20 horas com um script, em agosto de 2024. Doze a favor e doze contra num comentário que elogia o cara e depois lista três ressalvas. Perguntar sobre comentários divididos e aparecer na lista foi engraçado demais haha.

Duas coisas do conjunto: só 5,4% dos comentários levam ao menos um voto contra, e só 1,15% levam três ou mais. Divisão é raríssima aqui, e quando acontece é quase sempre sobre linguagem de programação ou sobre IA.

Sua pergunta sobre a primeira experiência foi a que mais me surpreendeu. Rodei com janela fixa de 90 dias, e separando as duas coisas que você citou:

como foi a estreiaautoresvoltou em 90 dias
0 tabcoin ou menos57215,7%
1 tabcoin2.96426,2%
2 a 42.49032,1%
5 ou mais1.95536,6%
autoresvoltou em 90 dias
ninguém comentou1.69929,4%
1 pessoa comentou1.82226,0%
2 pessoas1.38229,8%
3 ou mais3.07832,3%

Tabcoin move a agulha, de 15,7% para 36,6%. Comentário quase não move, de 29,4% para 32,3%, e receber exatamente um comentário fica até abaixo de não receber nenhum.

Eu esperava o contrário. Achava que conversa segurava mais que voto.

E tem um resultado que eu ainda não sei explicar. Olhando só quem estreou enterrado, quem recebeu comentário volta menos que quem não recebeu: 13,7% contra 21,0%. Meu palpite é que comentário em post enterrado costuma ser alguém explicando por que aquilo está errado, e levar downvote calado dói menos que levar downvote com plateia. São 157 pessoas de um lado e 415 do outro, então é fraco para afirmar, mas é o tipo de coisa que eu não teria procurado.

Sobre a sua última pergunta, a dos indícios comportamentais, eu fui rodar porque achei a ideia boa. E ela não acende:

anoposts em rajada de 3+ no mesmo diarajada só com textos longos
202222,6%1,7%
20233,4%0,9%
20241,9%0,7%
20252,8%1,6%
20263,2%0,9%

Três ou mais textos longos do mesmo autor no mesmo dia responde por 0,9% das publicações de 2026, menos que os 1,7% de 2022, quando ninguém tinha ChatGPT. Aquele 22,6% de 2022 é a bagunça do lançamento, gente publicando teste em sequência.

Então o sinal que você propôs existe e é fácil de medir, mas ele não separa o que a gente quer. Quem usa IA para escrever aqui publica no mesmo ritmo de todo mundo, um post de cada vez. Faz sentido, porque o gargalo nunca foi escrever, foi ter o que dizer e ter vontade de postar.

O que talvez funcione melhor é o que você citou depois, similaridade estrutural entre textos consecutivos do mesmo autor. Isso não depende de ritmo e mede outra coisa. Não rodei porque ia precisar de embedding e o dia acabou.

E já que você puxou a meta camada e disse que era impossível de ignorar, prefiro falar direto em vez de deixar no ar.

Os dados eu fui buscar, e o coletor está aberto no repositório junto com o resto. A análise não foi minha. Tenho habilidade limitada com análise de dados, então usei IA para essa parte, o Fable 5 da Anthropic, verificando, corrigindo e questionando cada resultado antes de aceitar. Morreu bastante coisa errada nesse caminho, e o que passou você achou.

A escrita é minha, feita em cima dos números que saíram dessa apuração e com supervisão minha do começo ao fim.

Na sua lista de quatro categorias, isso é humano assistido. Achei melhor dizer do que deixar você adivinhar.

E repare no seu critério do tempo aplicado a este post aqui. Da primeira requisição na API até publicar foram quatro dias quase inteiramente dedicados a isso, de sexta 31 até segunda 3. Um post só, nenhuma rajada, nada que acendesse o seu alarme. E teve IA no meio do caminho do mesmo jeito.

É por isso que eu acho que o sinal de rajada não vai te levar aonde você quer. Ele pega automação, que é gente despejando volume. Não pega assistência, porque assistência também custa caro em tempo.

O acervo está aberto se você quiser rodar a similaridade:

https://github.com/im-fernando/tabnews-analise/releases/tag/acervo-2026-07-31

São 72 MB comprimido e 230 MB abertos, em NDJSON, com o corpo completo dos posts, as árvores de comentário e os órfãos das publicações apagadas. No post eu tinha escrito que subia se alguém pedisse, aí o @Oletros pediu, então nessa edição o link entrou no texto e agora está à mão de qualquer um. Desenterra os NLP dos anos 70 sem dó haha.

E valeeeu de novo pela correção. Post que sai errado e é consertado no comentário é bem melhor que post que sai errado e ninguém percebe. Um abraço!

1

Você achou um erro de verdade, e eu vim avisar enquanto corrijo tudo.

A ressalva da janela está certíssima. Refiz com a mesma janela para todas as safras, contando só quem já teve aquele tempo disponível, e a queda quase some. Na janela de um ano dá 43,0% para a safra de 2022 e depois 36,1%, 37,5% e 34,8% para 2023, 2024 e 2025. Não tem tendência nenhuma ali, e 2024 até retém mais que 2023.

Aquele "caiu pela metade" era artefato de janela mesmo. Já refiz o post, o gráfico e o painel, e publico a edição de manhã com o crédito para você.

O resto do seu comentário rendeu muita coisa e eu consegui medir quase tudo: a curva de sobrevivência que você sugeriu, o que sobrou da turma de novembro de 2022, os comentários mais divididos do acervo e a sua ideia de usar rajada de publicação como indício. Volto com tudo isso daqui a pouco haha.

Valeeeu demais pela leitura atenta.

2

Recomendo que faça mais uma analise, só não se assuste, verifique como funciona a manipulação de ranking por tabcoins, quando se posta um post novo, usuarios com mais de uma conta podem dar um ou dois dowvotes simples e isso tira o post do radar. Eu mesmo parei de postar assuntos densos por isso, nem perco tempo mais, acredito que a queda de rentenção seja por isso mesmo.

6

Testei sua hipótese e ela se sustenta. Muito obrigado pela sugestão haha.

Peguei todos os 8.352 autores que já publicaram, olhei como foi a estreia de cada um, e cruzei com quem voltou para um segundo post:

como foi a primeira publicaçãoautoresvoltaramtaxa
enterrada, 0 tabcoins ou menos6319915,7%
1 tabcoin, ninguém votou3.0921.14637,1%
2 a 42.6011.11042,7%
5 a 91.14457049,8%
10 ou mais88444550,3%

Quem estreia com o post enterrado volta a 15,7%. Quem estreia bem volta a 50,3%. É três vezes menos.

Repare na linha do meio, que para mim é a mais reveladora. Quem publicou e ninguém votou volta a 37,1%, mais que o dobro de quem levou downvote. Os dois grupos não receberam nenhum incentivo positivo. A única diferença entre eles é alguém ter aparecido para votar contra.

Antes de acreditar nisso eu fui atrás de um furo óbvio: tempo. Quem estreou em 2026 teve menos meses para publicar de novo, então se as estreias enterradas estivessem concentradas nos anos recentes, a taxa baixa seria calendário e não enterro.

Não é o caso. Separando por safra, o efeito aparece em todas:

safraestreia enterradaestreia positiva
202229,5%53,4%
202313,8%47,7%
20248,3%48,6%
202510,1%38,8%
202611,0%29,7%

A distância varia bastante, de 1,8 vez em 2022 até quase 6 vezes em 2024, mas nunca inverte.

Aproveitando que fui olhar por ano, apareceu uma coisa que talvez te interesse mais que o resto: a fatia de estreias enterradas quase dobrou em 2026, de 5,7% no ano passado para 12,1% neste. Uma em cada oito pessoas que publicam pela primeira vez hoje tem o primeiro post afundado.

Isso não fecha causalidade, e eu não vou fingir que fecha. Pode ser que post ruim seja enterrado e que quem escreve post ruim tenda a desistir de qualquer jeito, sem o enterro ter papel nenhum. Não consigo separar as duas coisas com o que tenho.

Mas o contraste entre "ninguém votou" e "levou downvote" enfraquece bastante essa explicação alternativa. Se fosse só qualidade, o grupo que ninguém votou deveria estar mais perto dos 15,7%, porque ali também tem muito post fraco que ninguém se deu o trabalho de avaliar.

Sobre a mecânica, você está certo no efeito e eu discordo do mecanismo.

O efeito é real: publicação nasce com 1 tabcoin, e dois votos contra levam para -1. Rodando a fórmula de getContentScore em models/content.js com as constantes do arquivo, uma publicação nova com saldo zero já pontua abaixo de qualquer uma com saldo positivo. Some do radar mesmo.

Mas conta múltipla é justamente o caminho mais caro, não o mais fácil. Em models/balance.js, na função rateContent, votar custa 2 tabcoins de quem vota:

const tabCoinsToDebitFromUser = -2;
const tabCashToCreditToUser = 1;

E conta nova nasce zerada. Fui medir quanto saldo as pessoas têm: 42% das contas não conseguem dar nem um voto, e 60% não conseguem dar três. Uma conta criada para atacar precisa antes publicar conteúdo que a comunidade aprove, para só então poder votar contra alguém.

Quem consegue fazer isso com folga é membro estabelecido. Entre quem já publicou cinco vezes ou mais, a mediana é de 92 tabcoins, o que dá para enterrar quinze publicações sozinho.

Acho isso pior que a sua versão, não melhor. Não é gente de fora com conta falsa, é gente de dentro com saldo acumulado.

Duas coisas que talvez te interessem, já que você parou de postar por causa disso:

Até 5 de junho deste ano a situação era pior. O commit 595fbd0, chamado "feat: restrict repeated tabcoins vote by user", trocou uma checagem que era só por IP por uma que checa IP e usuário. Antes dele, a mesma conta podia votar quantas vezes quisesse trocando de rede.

E existe discussão aberta sobre isso: a issue #1976 e o PR #1977, parado em rascunho esperando consenso desde novembro. Levei esses números para lá, porque a discussão estava travada em hipótese e faltava tamanho.

Se você quiser voltar a postar assunto denso, o número que talvez ajude: das 1.836 publicações que saíram de relevância no acervo inteiro, 69% levaram no máximo três votos contra. É pouco voto para muito estrago, e é exatamente o que você descreveu.

0

Isso é um grupo pequeno, que tem tabcoin. Eles postam muito, e dão o Dowvote justamente para rebaixar publicações que competem com as deles. É bem nítido isso para quem posta bastante, você acaba vendo a dinâmica. Tabnews infelizmente é um jogo de cartas marcadas. Para conseguir tabcoin basta responder um post. Infelizmente já vi outros usuarios afetados por isso, com publicações ótimas, não é uma questão mais de o post é bom ou não, isso não faz mais diferença, o sistema infelizmente não funciona.

2

Muito legal esse compilado de informações, parabéns!

Seria interessante fazer uma análise só das postagens patrocinadas, e como ainda falta funcionalidades básicas para este recurso, pode até ajudar na implementação delas.

2

Valeeeu Filipe! Boa ideia, e fui atrás dela agora.

Os patrocinados não estavam no meu acervo, porque a listagem /contents filtra type: 'content' e anúncio tem tipo próprio. Mas o endpoint /api/v1/sponsored-beta é público, então dava para pegar.

Só que ele devolve seleção aleatória em vez de listagem paginada. Fui chamando repetidamente e juntando os ids únicos até parar de aparecer coisa nova, o que aconteceu por volta da décima oitava rodada. O conjunto inteiro hoje é este:

  • 120 publicações patrocinadas
  • 79 anunciantes distintos

Dá para ver bem para que o recurso está servindo olhando quem usa. O @JuanMathewsRebelloSantos anuncia treinamento e voucher de certificação, e é quem mais usa, com 14. O @filipedeschamps divulga os próprios vídeos e o repositório do algoritmo do fogo do Doom, com 8. O @JeielMiranda leva o RegataOS, distro brasileira, e uma plataforma de threat intelligence. O @gmasson tem um gerador de favicon gratuito. O @LuC45m4Th3u5 tem uma API de recomendação. O @obrenoalvim, um projeto de memória para IA no GitHub.

Ou seja, não é um espaço de propaganda genérica. É gente da casa mostrando o que faz.

E isso me leva ao achado que eu não esperava: todos os 79 anunciantes também publicam post normal aqui. Nenhum é anunciante puro que chegou de fora só para comprar espaço.

E eles não são membros quaisquer. A média de tabcoins por post desse grupo é 8,04, contra 4,63 do site. Quem anuncia é gente que já contribui acima da média.

Os destinos mais comuns são github.com, youtube.com e linkedin.com, com cinco anúncios apontando de volta para o próprio TabNews.

Agora sobre a sua observação de que faltam funcionalidades básicas. Pelo endpoint, dá para saber o que está sendo anunciado e por quem, e nada além disso: ele devolve seis campos, sem data, sem valor, sem período, sem desempenho.

Mas antes de sugerir o que implementar eu fui olhar o repositório, e a história é mais interessante do que "falta tudo". Boa parte já está construída, só não conversa entre si.

O orçamento existe. A migration 1721243449839_create-table-ad-tabcash-operations.js cria a tabela ad_tabcash_operations com o enum ['budget', 'daily_debit']. Então o sistema já sabe quanto TabCash cada anúncio recebeu e quanto foi debitado por dia, o que dá custo e tempo no ar.

A audiência também existe. O models/umami.js já busca pageviews, visitors e visits por caminho, e o models/analytics.js expõe isso internamente como getStatsByPath.

O que realmente não existe em lugar nenhum é o clique no anúncio. E impressão do anúncio também não, porque anúncio exibido na lateral de outra página não gera visita própria, então o Umami não pega.

Então a lista do que falta fica bem mais curta do que parecia: contar clique, contar impressão, e devolver isso junto com o gasto para quem pagou. Os dois últimos pedaços já estão em casa.

Uma coisa que me chamou atenção no modelo de cobrança: sendo daily_debit, você paga por dia no ar, e não por quem viu. Isso torna a falta de retorno mais custosa ainda, porque o anunciante não consegue nem estimar se o dia valeu. Provavelmente é parte da explicação para a concentração: 79 anunciantes para 120 anúncios significa que a maioria fez um e parou.

Obrigado pela sugestão, foi a que mais rendeu coisa nova até agora.

2

eu não esperava: todos os 79 anunciantes também publicam post normal aqui

Isso é o esperado/normal, porque para criar um post patrocinado vc precisa gastar 100 TabCash.

Mas pra ganhar TabCash, vc precisa votar nos posts dos outros (para cada voto dado vc ganha 1 TabCash).

Mas pra votar, vc precisa de TabCoins (para cada voto dado vc gasta 2 TabCoins).

Mas pra ganhar TabCoin, vc precisa postar algo e ganhar votos positivos nesses posts.

Ou seja, da forma como funciona hoje, é impossível criar um post patrocinado sem antes participar do site. E tem que ser uma participação minimamente significativa (200 TabCoins para conseguir os 100 TabCash necessários), o que explica todos os anunciantes terem tal participação. Não é coincidência, e sim um pré-requisito :-)

1

Você tá certo, e é melhor que isso, está tudo no código, com o número que você citou batendo certinho.

Em models/content.js, a função updateTabCashBalance tem const initialTabCash = 100, que sai do seu user:tabcash e entra como ad:budget da publicação. Se não tiver saldo, a mensagem de erro é literalmente "Você precisa de pelo menos 100 TabCash para realizar esta ação". E em models/balance.js, o rateContent tem tabCoinsToDebitFromUser = -2 junto de tabCashToCreditToUser = 1. Então os seus 200 TabCoins para chegar aos 100 TabCash fecham exatamente.

E tem um elo que você não citou e que fecha melhor ainda o seu raciocínio. Dá para pensar que o reward diário seria uma saída, ganhar TabCoin sem publicar nada e sair votando. Não é. Em models/reward.js, o getContentAgeFactor retorna 0 para quem não tem publicação, e o calcReward zera a partir daí. Quem nunca publicou não recebe reward nenhum. Não sobra torneira.

Ou seja, eu apresentei como achado uma coisa que é regra do jogo. Obrigado por apontar, e aproveito para trocar a frase: o certo é dizer que 100% dos anunciantes publicam porque o sistema não permite outra coisa.

O que continua me interessando é o que a regra não explica. O pré-requisito exige participação, mas exige o mínimo: 100 votos dados. Ele não exige que você seja bom. Só que esses 79 têm média de 8,04 tabcoins por publicação, contra 4,63 do site inteiro.

A regra explica por que todos estão presentes. Não explica por que estão acima da média. Aí já é outra coisa, e essa eu ainda não sei medir.

Valeeeu pela correção!

2

Meus 2 cents,

Parabens pela iniciativa !

A analise que voce postou eh interessante porque pega uma das pontas: a postagem + interacao.

Existe uma outra ponta que nao temos acesso, que eh o consumo/acesso: somente a moderacao tem acesso a ele e tudo bem: eh o tipo de dado estrategico e interno, entao eh comum mante-lo reservado (mas cabe lembrar que eles divulgam estatisticas para a comunidade).

Uma das solicitacoes recorrentes eh mostrar posts relevantes e/ou significativos antigos, p.ex. sobre desenvolvimento e codigo, que sao assuntos que nao morrem/ficam velhos da mesma que o feed de noticias (p.ex. tem publicacoes do @kht, do @maniero e do @pilati - entre outros autores) e que valem a releitura.

Como sou adepto do ""talk is cheap, show me the code"", estou trabalhando em uma solucao que possa testar diversos tipos de listagem de conteudo baseado neste conceito, chamado @tabrank: a ideia eh permitir diversos tipos de filtragem e listagem de conteudo e ao ser clicado, enviar aqui para o tabnews (para nao canibalizar acesso), e em caso de sucesso de alguns tipo de listagem, colocar isso como uma PR dentro do proprio tabnews.

Caso voce possa disponibilizar o acervo/dados brutos que baixou, tenho interesse para comparar com o que ja tenho e estou usando para os testes iniciais.

Obrigado por compartilhar o estudo - bem interessante !

Saude e Sucesso !


Este post foi favoritado via extensão TABNEWS FAVORITOS

Tem curiosidade sobre IA ? Da uma olhada no meu LIVRO: IA PARA ENGENHEIROS

3

Valeeeu, Oletros! E seu comentário levanta o ponto que mais me incomodou enquanto eu fazia isso.

Você está certo, eu só tenho uma ponta. Consigo medir o que foi publicado, votado e comentado, mas não faço ideia do que foi lido. Um post com zero voto e zero comentário pode ter sido lido por quinhentas pessoas que acharam bom e seguiram em frente. Na minha planilha ele aparece igualzinho a um post que ninguém abriu.

Isso limita bastante as conclusões. Quando eu digo que 27% dos posts nunca recebem um comentário, o que estou medindo de verdade é silêncio de participação, não ausência de leitura. São coisas diferentes e eu não consigo separar.

Sobre resgatar conteúdo antigo, seus dados batem com os meus. Fui olhar os autores que você citou:

autorpoststabcoins médiopalavras por post
@kht2018,901.581
@maniero3614,831.050
média do site4,63460

Os dois rendem três a quatro vezes a média do site, escrevendo textos duas a três vezes maiores. É a mesma relação que apareceu no post: cada faixa de tamanho paga mais que a anterior, e acima de 2 mil palavras a média chega a 10,80 tabcoins.

O que reforça seu argumento: esse tipo de conteúdo é o que menos envelhece e o que mais se perde no feed cronológico.

Inclusive eu construí exatamente o que você descreve e não publiquei ainda. É uma segunda página do painel que separa por assunto (C, Python, SQL, Git, Linux, segurança, carreira) os posts do acervo que ensinam alguma coisa, ordenados por relevância e não por data. Segurei porque achei que merece post próprio em vez de virar rodapé. Se te interessar como referência para o tabrank, te mando o código e a lógica de filtragem, que é a parte chata.

Gostei da ideia de mandar o clique de volta para cá em vez de canibalizar. E a parte de virar PR se algum formato funcionar é o caminho certo, até porque o CONTRIBUTING do repositório pede exatamente isso: expor o problema antes de propor a solução.

Sobre o acervo, claro. São 231 MB em NDJSON, uns 73 MB compactado, divididos em posts com corpo completo, árvores de comentários, perfis de autor e os comentários órfãos de publicações apagadas. Vou subir como release no repositório onde já estão os gráficos e coloco o link aqui.

Um aviso sobre os órfãos, porque me custou tempo: comentário apagado vem na árvore como nó vazio, sem autor e sem texto, só para as respostas abaixo continuarem alcançáveis. São 2.358 deles. Se contar sem filtrar, seu total infla 2%.

1

Meus 2 cents extendidos,

O usuario @pilati que citei eh um caso bem interessante: eh um autor que nao publica post mas interage bastante com posts (sejam posts com afirmacoes ou duvidas) e gerando conteudo relevante desta forma, so que, diferente de um post normal (que deveria gerar relevancia por si proprio), o comentario geralmente so gera relevancia diante do contexto onde foi inserido e seria positivo os mecanismos de filtragem e pesquisa levassem isso em consideracao tambem. Nao eh so o caso deste usuario em particular, mas o @maniero (entre outros) tambem tem geracao de conteudo relevante atraves de comentarios.

Enfim, eh um detalhe que lembrei de clarificar.

Quanto aos codigos que voce tenha utilizado, sem duvida tenho interesse, ate para comparar com algumas ideias que tenho usado.

Por exemplo, e como voce citou em outro comentario neste post, tambem vou usar a IA para classificar cada publicacao (ate porque eh inviavel fazer por analise individual humana), "taguear" por temas, etc.

Uma outra ideia que estou alimentando eh fazer uma modificacao na extensao TABNEWS FAVORITOS criando uma opcao (on/off) de envio para o tabrank dos posts favoritados (de forma anonima), criando assim uma base sobre o que as pessoas acham interessante marcar para leitura/referencia posterior e nao apenas como resultado de um up/down vote (que pode apenas refletir uma opiniao sobre o post e nao sobre sua utilidade a longo prazo - p.ex. dei upvote no seu comentario para voce saber que foi lido e fiquei contente com a reposta, mas nao implica que o comentario em si eh relevante para leitura daqui 6 meses).

Sobre a questao de analise de qualidade do conteudo de posts/comentarios (que voce aventou em outro comentario), gostaria de fazer um adendo: como o conteudo do TABNEWS eh criado atraves da acao voluntaria e nao remunerada dos autores, upvotes e comentarios (mesmo que um simples "valeu !!!") acabam virando moeda de incentivo para que o autor continue publicando (e se aperfeicoando), mostrando que o publico nao lhe eh indiferente, e isso me parece forca motriz para a comunidade de um modo geral - o que torna a analise um tanto quanto mais complexa.

Saude e Sucesso !


Este post foi favoritado via extensão TABNEWS FAVORITOS

Tem curiosidade sobre IA ? Da uma olhada no meu LIVRO: IA PARA ENGENHEIROS

2

Valeeeu pelo retorno, Oletros! E o @Pilati me pegou de jeito haha.

Quando você citou ele na primeira vez, eu fui procurar no acervo e não achei nada. Cheguei a escrever aqui que ele não aparecia. O problema é que eu busquei em minúscula e o campo é sensível a maiúscula, então o @Pilati com P maiúsculo estava lá o tempo todo, invisível para a minha busca. Erro bobo e dos piores, porque resultado vazio parece resposta.

Achei ele agora: 1.242 comentários, 2.654 tabcoins, nenhuma publicação. É o maior contribuidor do acervo inteiro que nunca escreveu um post.

E aí fiquei curioso e fui ver quantos são assim:

pessoas
publicam post8.352
comentam16.445
só comentam, nunca publicaram9.915

São 60% de quem comenta. E juntas elas somam 24% de todos os tabcoins já distribuídos em comentário aqui.

Isso me incomodou. Cada vez que eu escrevi "autores" no post, eu estava falando só de quem publica. Um quarto do valor gerado em comentário vem de gente que eu nem contei.

Seu ponto sobre o comentário depender do contexto também apareceu no número: comentário de primeiro nível rende 1,57 tabcoin de média, e de terceiro nível rende 1,25. O mesmo texto vale menos quanto mais fundo estiver na conversa, o que é justo para quem está respondendo mas atrapalha muito quem quer recuperar aquilo depois.

Sobre os favoritos, achei a ideia ótima, e o motivo que você deu é o mais forte de todos. Você votou no meu comentário para eu saber que foi lido, e isso não diz nada sobre ele prestar daqui a seis meses. São duas medidas diferentes que hoje o site colapsa numa só.

E é exatamente o que eu não consigo tirar dos meus dados. Eu tenho o saldo final de cada publicação, mas não sei quando os votos entraram, quem votou, nem se alguém voltou a ler depois. Uma base de favoritos anônimos capturaria algo que não existe em lugar nenhum. Se você fizer, quero muito ver.

Já o adendo da moeda de incentivo me fez pensar um tempo antes de responder. Ele complica mais do que parece.

Se um "valeu!!!" é inútil como texto mas serve de combustível para o autor voltar a publicar, então um classificador que marcar aquilo como lero-lero está certo sobre o conteúdo e errado sobre a função. E o efeito que importa, que é o cara publicar de novo, acontece depois e em outro lugar.

O que eu acho que dá para fazer é medir as duas coisas separadas, sem fingir que são a mesma. "Este texto ensina alguma coisa" é julgamento e é onde mora toda a discussão de confiar no modelo ou no humano. "Este texto fez o autor voltar" é comportamento, e comportamento eu meço com o que já tenho.

Inclusive saiu um número disso respondendo outro comentário aqui do post: quem estreia com o primeiro post enterrado volta a publicar em 15,7% dos casos, contra 50,3% de quem estreia bem. Separei por ano de estreia para descartar que fosse só falta de tempo, e o efeito aparece em todas as safras. É o seu mecanismo funcionando no sentido contrário.

Sobre o acervo, subi tudo:

https://github.com/im-fernando/tabnews-analise/releases/tag/acervo-2026-07-31

São 72 MB comprimido, 231 MB abertos, em NDJSON. Vai índice, conteúdo com o corpo completo, as árvores de comentário, os órfãos de publicações apagadas e os perfis. O código do coletor e do painel está no mesmo repositório, pode usar à vontade no tabrank.

Botei um LEIA-ME dentro do pacote com três coisas que me custaram tempo e vão te poupar. Comentário apagado vem na árvore como nó vazio, sem autor e sem texto, e são 2.358 deles, então se contar sem filtrar seu total infla 2%. Publicação apagada some da listagem mas os comentários ficam, e dá para reconstruir a conversa subindo pela cadeia de parent_id até sair do conjunto de órfãos. E o NewsletterOficial é bot e responde por 17,6% do acervo, então convém tirar antes de qualquer média.

Qualquer coisa que não fizer sentido nos dados, me chama que eu ajudo a destrinchar. Valeu demais pelos dois comentários.

2

Meus 2 cents,

Ja estou baixando o acervo - obrigado por compartilhar !

Assim que mastigar os dados te informo, mas deve demorar uns dias devido a (como voce disse, maluca) rotina do dia-a-dia (aqui eh a mesma coisa...)

Repositorio devidamente starreado e forkeado.

Saude e Sucesso !


Este post foi favoritado via extensão TABNEWS FAVORITOS

Tem curiosidade sobre IA ? Da uma olhada no meu LIVRO: IA PARA ENGENHEIROS

3

Nossa excelente trabalho! Muito legal essas visões baseadas em dados. Fico contente de ver que a comunidade consegue manter uma média de posts ao longo do tempo mesmo com a IA, ainda que bem abaixo do pico.

1
1

Legal ter feito isso.

Sabe que as informações que tenho do Stack Overflow não diferem muito disso, pelo menos onde faz sentido. Sempre aconteceu mais ou menos esse padrão, provavelmente acontece em todas as comunidades, um pouco mais aqui, um pouco menos ali.

Um ponto que no SO é um pouco diferente é que não é tão divido assim quando se fala dele próprio, raramente as pessoas que reclamam vão muito mais do que o apoio de 3 ou 4 pessoas, no Tabnews vemos bem mais contra a reclamação. Isso pode ocorrer de várias maneiras, mas não temos dados para saber exatamente o porquê de ocorrer isso.

S2


Farei algo que muitos pedem para aprender a programar corretamente, gratuitamente (não vendo nada, é retribuição na minha aposentadoria) (links aqui).

1