1

Bem interessante. Usei uma abordagem parecida no dupehound (https://github.com/rafaelpta/dupehound): tree-sitter pra normalizar a sintaxe e um algoritmo de detecção de plágio (winnowing) pra fazer o fingerprint da estrutura. Com isso ele acha funções duplicadas mesmo depois de renomear todos os identificadores. LLM não resolve esse tipo de coisa por dois motivos: 1) é não determinístico,e um gate de duplicação precisa do mesmo veredito pra mesma entrada; 2) a janela de contexto não
comporta o codebase inteiro muitas vezes pra comparar cada função contra todas as outras (coisaum índice faz).

Carregando publicação patrocinada...