Dois modelos chineses de IA acertaram 100% da prova da Olimpíada Internacional de Matemática em julho, sem intervenção humana. É o primeiro registro de gabarito total em um desafio desse tipo.
Os modelos de inteligência artificial Celia, da Huawei, e dots-node-3.0, da Xiaohongshu, alcançaram um feito inédito ao gabaritar a prova da Olimpíada Internacional de Matemática (IMO), superando competidores humanos. Este é o primeiro registro de uma tecnologia de IA acertando 100% das questões em um desafio desse tipo.
A prova foi realizada em julho, sem qualquer intervenção humana, e as questões foram liberadas apenas após a finalização da prova pelos estudantes que participaram. No ano anterior, modelos de IA de empresas como Google e OpenAI apresentaram resultados positivos, mas não conseguiram gabaritar a prova.
De acordo com a Xiaohongshu, atingir a pontuação máxima é uma tarefa extremamente difícil. Isso é evidenciado pelo desempenho dos participantes humanos: entre 666 concorrentes em Xangai, apenas sete conseguiram acertar todas as questões. A empresa informou que este foi o primeiro teste do seu modelo com as questões da IMO.
Conforme o Taipei Times, as questões foram disponibilizadas para os modelos de IA apenas após serem resolvidas pelos estudantes reais. Além disso, ficou estabelecido que não haveria intervenção humana durante a resolução das questões.
A Menlo Ventures, uma empresa de capital de risco dos Estados Unidos, também realizou testes com o auxílio de um parceiro para avaliar a taxa de acerto de IAs americanas, já que elas não participaram oficialmente da prova. Modelos como o ChatGPT na versão GPT-5.6 Sol (OpenAI), Claude Fable 5 (Anthropic) e a ferramenta da Axiom Math também obtiveram resultados perfeitos nos testes.
Vale ressaltar que essa não é a primeira vez que modelos de IA são testados na Olimpíada Internacional de Matemática. Em 2024, o modelo da DeepMind, pertencente ao Google, conquistou a medalha de prata ao acertar quatro das seis questões, embora a resolução tenha levado cerca de três dias. No ano seguinte, o modelo obteve uma nota que o qualificou para a medalha de ouro, assim como o ChatGPT, mas não atingiu a pontuação máxima. Os modelos exatos utilizados nos testes anteriores não foram revelados.
