cara, show de bola! 180+ fontes é muita coisa na real, principalmente se forem fontes com autoridade e relevância. talvez adicionar portais/sites muito pequenos não traga tanto ganho de interesse ou qualidade.
RSS também acaba sendo muito mais barato e simples do que rodar scraping, além de respeitar melhor a forma como o site disponibiliza o conteúdo. mas, para um volume grande de fontes, em algum momento provavelmente não tem jeito: vai ter que partir pro scraping.
sobre o Reddit, eles têm API que dá pra usar normalmente. o problema é que começar a combinar RSS + API + scraping já deixa o coletor bem mais complexo de manter.
já o robots.txt, pra falar a real, ninguém respeita kkkkk. todo mundo lê, mas ninguém indexa (tipo google). maior patifaria da história do SEO
— é o hype