Empresas de IA recorrem a livros impressos antigos para treinar modelos sem contaminação por texto gerado por IA
A ISBNdb, que mantém um dos maiores bancos de dados de livros do mundo e oferece aquisição em grande volume para esse mercado, afirma que as melhores fontes são obras publicadas antes de 2022, ano de lançamento do ChatGPT, pois grande parte do conteúdo disponível para raspagem atualmente na internet já pode incluir textos sintéticos, o que pode degradar a qualidade dos modelos e torná-los mais propensos a erros.