É RSS mesmo. Testei 108 feeds e APIs oficiais. O que mais pesa é se o feed traz o
texto completo ou não. Se traz, eu nem entro no site. Se vem só resumo ou título,
uso o feed pra achar a matéria e busco só aquela URL. Citei robots.txt porque tem
fonte que bloqueia, e tem umas que nem feed têm, tipo Anthropic e Meta AI, então
não tem jeito, tem que ficar de olho na página mesmo.
Tô pensando em escrever um post só sobre a coleta. Tem bastante coisa pra contar,
desde o levantamento das 108 fontes até termos de uso e paywall. Mas nesse projeto to tentando dar um foco diferente pra começar a documentar o processo antes mesmo de construir ou ter algo concreto em si. Valeu demais pelo comentário!
Tenho esse outro post que conta um pouco sobre o projeto e o motivo de eu estar fazendo ele:
https://www.tabnews.com.br/ticolls/vou-juntar-alguns-hypes-da-bolha-dev-e-coisas-que-quero-aprender-em-um-unico-projeto