3

GPT-6 Astra: o que a OpenAI lançou de verdade (e a polêmica dos benchmarks)

A OpenAI lançou dia 03/09 o GPT-6 Astra, sucessor do GPT-5.6 Sol. Fui atrás das docs oficiais e do system card pra separar fato de hype.

Specs (docs da API):

  • Model id gpt-6-astra, contexto de 1.050.000 tokens (input máx 922K, output 128K)
  • Computer use ~2x mais rápido, MCP, hosted shell, code interpreter
  • Preço: US$ 10/M input, US$ 50/M output — acima de 272K tokens vira US$ 20/75 (~2,5x o Sol)

O que chamou atenção:

  • Primeiro modelo com nível "Crítico" de cibersegurança no Preparedness Framework da própria OpenAI — a versão pública tem guardrails; acesso pleno só pelo programa Daybreak
  • Brockman falou em "era da AGI", mas o índice agregado da Artificial Analysis dá 61,2 vs 60,9 do Sol — o salto real é em agentic/computer use (OSWorld 72,6% vs 65,7%), não em "inteligência geral"
  • Polêmica: 99,9% no ARC-AGI-3 no harness da própria OpenAI vs 62,7% no harness padrão
  • Rollout confuso: pagantes travados no D1, Altman pediu desculpas e prometeu compensação

Escrevi uma análise completa em pt-BR, incluindo comparação com o Claude Fable 5.1: https://www.techknow.com.br/post/gpt-6-astra

O que vocês acham da diferença entre benchmark de harness próprio vs padrão? Marketing ou metodologia legítima?

Carregando publicação patrocinada...
1

AGI vai ser o momento que esses modelos fazem atrás de um computador uma tarefa que qualquer ser humano faria. Em inteligência bruta desde o gemini 2.5 eles já superaram a média da população mundial. Então não precisa de mais pontos no Artificial Analysis.

Só que ainda não chegou.. No OSWorld 2.0, o Astra marca 72,6% em cerca de 40 minutos por tarefa. Um humano chega perto de 100% nessas mesmas tarefas em poucos minutos. Eu apostaria que o próprio GPT-6... nas versões .2 ou .3 (antes do fim do ano chega lá).