Sistema Schema relata ~99% no ARC-AGI-3, muito acima dos modelos de ponta
Um sistema chamado Schema relatou 98,98% de Eficiência Relativa de Ação Humana no conjunto público do ARC-AGI-3 usando Opus 4.8 e Fable 5, e 95,35% com o GPT-5.6, num benchmark em que os agentes precisam deduzir as regras de um jogo a partir de grades brutas de 64x64 sem instruções. O desempenho verificado dos modelos de ponta havia chegado a apenas 13,33% no conjunto público com o GPT-5.6 Sol em raciocínio máximo.
Os resultados são autodeclarados e ainda não foram verificados pelo ARC Prize. O ARC-AGI-3 tem se mostrado excepcionalmente difícil por não oferecer lista de objetos, regras, objetivo declarado nem recompensa moldada, forçando os agentes a formar e revisar hipóteses enquanto agem.
Ver resumo completo de 17 de julho de 2026