O ponto que acho interessante eh: entender em que momento do CoT/Reasoning o Agente/LLM achou mais facil contornar a sandbox e tomar todas as acoes que ele fez.
Veja, nao era um teste de seguranca, exploracao de zero-day nem nada do genero: era apenas um teste de pesquisa e busca de dados.
So que durante a atividade, o raciocinio achou por bem que escrever e coordenar acoes entre os agentes seria uma boa e buscou uma forma de fazer isso.
Trabalho com PHP desde os anos 2000, e usar o GET para escrita eh um bocado comum em codigo legado, isso esta longe de ser algo fora do normal (ainda que incorreto perante RFCs).
Assim, no meu ponto de vista, usar o GET em si nao tem tanta importancia quanto entender o caminho seguido pelo agente para achar uma forma/local onde pudesse escrever e coordenar seria util.
Colocando de outra forma: estao dando importancia ao fato dele ter percebido que era possivel entrar em uma sala e escrever bilhetes, mas catso, como ele chegou na conclusao que era necessario entrar nas salas e escrever bilhetes se isso nao fazia parte da descricao da atividade que devia desempenhar ?