GPT do OpenAI 6 Astra demonstra grandes avanços na codificação, raciocínio científico e tarefas profissionais, superando o GPT- 5.6 Sol e vários modelos de Claude em pontos de referência chave A OpenAI desvelou GPT- 6 Astra junto com resultados de referência que sugerem maiores ganhos em codificação, raciocínio científico, uso de computador e tarefas profissionais. A empresa descreve o Astra como o seu modelo mais capaz e alinhado ainda. Os resultados publicados colocam- o à frente do GPT- 5.6 Sol e vários modelos de Claude em muitos testes, embora Claude Fable 5.1 mantém a liderança em pelo menos uma avaliação proeminente. Os números foram publicados pela OpenAI, por isso devem ser entendidos como resultados reportados pela empresa em vez de um veredicto independente completo sobre o desempenho do mundo real. Comparações de benchmark também podem depender da configuração do raciocínio, acesso à ferramenta e limites de gasto usados para cada modelo. Os resultados, portanto, oferecem um instantâneo útil do desempenho nas condições de teste da OpenAI, mas não garantem o mesmo ranking para cada tarefa de trabalho, codificação ou pesquisa. De acordo com os parâmetros publicados da OpenAI, Astra marcou 64.6 por cento na Ciência de Terminal-Bench 0.1, que mede se os agentes de IA podem completar fluxos de trabalho científicos usando ferramentas de código e terminal. Fábula de Claude 5.1, desenvolvido por Anthropic, marcado 52.6 por cento na comparação da OpenAI, enquanto GPT- 5.6 Sol alcançado 22.4 por cento.
Astra também marcou 57.9 por cento no Terminal-Bench 4.0, que cobre o trabalho baseado em terminales, incluindo engenharia de software, configuração de sistema e análise de dados. Fábula de Claude 5.1 alcançada 55.8 por cento, enquanto GPT- 5.6 Sol marcado 37.3 por cento. No entanto, o Astra não liderava todas as avaliações. Fábula de Claude 5.1 marcado 65 por cento no último exame da Humanidade com ferramentas, comparado com o Astra 57.2 por cento. A OpenAI não publicou um GPT- 5.6 Solução do resultado para esse teste na mesma tabela. Algumas das maiores melhorias relatadas pelo Astra apareceram nas avaliações científicas e profissionais. Na Nível de Matemáticas de Fronteira 4 (v) 2 ), Astra marcado 97.6 por cento, à frente do Claude Fable 5.1 em 87.8 porcentagem e GPT- 5.6 Solução em 83 por cento. Astra gravado 96 por cento no GPQA Diamond, comparado com 94.6 por cento para o GPT- 5.6 Solar e 93.7 por cento para Claude Fable 5.1.
O modelo também marcou 41.4 por cento em AutomationBench, que avalia tarefas profissionais de computador. Fábula de Claude 5.1 alcançado 31.4 por cento, enquanto GPT- 5.6 Sol alcançado 18.1 por cento. No BenchCAD, Astra gravado 95.9 por cento, comparado com 84.3 por cento para Claude Fable 5.1 e 83.3 por cento para o GPT- 5.6 Sol. GPT- 6 Astra é o mais moderno da arte em: ї Usar o computador ї Navegar ї Codificação agrária ї Ciência ї Trabalho profissional pic.twitter.com/YMDrLJs 2 ej OpenAI diz que Astra pode lidar com trabalhos complexos e de vários passos envolvendo navegadores, ferramentas de software, documentos, planilhas e apresentações. O cartão de sistema da empresa diz que Astra é o primeiro modelo a atingir o limiar de capacidade de cibersegurança crítica sob seu Quadro de Preparação. A OpenAI observa que o Astra demonstrou habilidades avançadas para identificar vulnerabilidades de segurança anteriormente desconhecidas sob avaliação controlada. A empresa disse que reforçou as salvaguardas contra o uso indevido e ações não autorizadas antes de ser liberada. O cartão de sistema também identifica limitações, incluindo a visibilidade reduzida em partes do raciocínio interno do Astra em comparação com o GPT- 5.6 Sol.
GPT- 6 A Astra está a ser inicialmente implantada para um grupo limitado de organizações. OpenAI diz que o acesso se expandirá nos dias seguintes para usuários ChatGPT Plus, Pro, Business e Enterprise, bem como através da API OpenAI e dos Serviços Web do Amazon. Os resultados do parâmetro de referência indicam um avanço substancial sobre o GPT- 5.6 Solução em várias categorias. Ainda assim, o desempenho varia por tarefa, e os resultados da OpenAI mostram que o Astra não supera o Claude em todos os testes. As comparações do mundo real dependerão, em última análise, de fatores como precisão, velocidade, custo, confiabilidade e como cada modelo executa condições de referência fora controladas. 2026. Todos os direitos reservados.