GPT-6 Astra: o que a OpenAI lançou de verdade (e a polêmica dos benchmarks)
A OpenAI lançou dia 03/09 o GPT-6 Astra, sucessor do GPT-5.6 Sol. Fui atrás das docs oficiais e do system card pra separar fato de hype.
Specs (docs da API):
- Model id
gpt-6-astra, contexto de 1.050.000 tokens (input máx 922K, output 128K) - Computer use ~2x mais rápido, MCP, hosted shell, code interpreter
- Preço: US$ 10/M input, US$ 50/M output — acima de 272K tokens vira US$ 20/75 (~2,5x o Sol)
O que chamou atenção:
- Primeiro modelo com nível "Crítico" de cibersegurança no Preparedness Framework da própria OpenAI — a versão pública tem guardrails; acesso pleno só pelo programa Daybreak
- Brockman falou em "era da AGI", mas o índice agregado da Artificial Analysis dá 61,2 vs 60,9 do Sol — o salto real é em agentic/computer use (OSWorld 72,6% vs 65,7%), não em "inteligência geral"
- Polêmica: 99,9% no ARC-AGI-3 no harness da própria OpenAI vs 62,7% no harness padrão
- Rollout confuso: pagantes travados no D1, Altman pediu desculpas e prometeu compensação
Escrevi uma análise completa em pt-BR, incluindo comparação com o Claude Fable 5.1: https://www.techknow.com.br/post/gpt-6-astra
O que vocês acham da diferença entre benchmark de harness próprio vs padrão? Marketing ou metodologia legítima?