AI 수학자의 현주소
자연대 홍보기자단 자:몽 9기 | 박준영
AI가 수학에서 맡는 역할은 계산기의 연장이 아니다. 최근의 쟁점은 답을 빠르게 계산하는 능력보다, 정리의 증명 경로를 찾고 그 정당성을 검증할 수 있는가에 있다. 다만 “AI가 수학을 풀었다”라는 말은 여러 층위를 가진다. 객관식 답을 맞힌 것인지, 사람이 읽을 수 있는 풀이를 낸 것인지, Lean 같은 형식 언어로 기계 검증 가능한 증명을 완성한 것인지에 따라 의미가 크게 달라진다.
가장 분명한 이정표는 Google DeepMind의 AlphaGeometry다. 2024년 Nature 논문과 DeepMind 발표에 따르면 AlphaGeometry는 2000~2022년 국제수학올림피아드(IMO) 기하 문제에서 추린 30문제 중 25문제를 제한 시간 안에 풀었다. 이전 대표 기법인 Wu’s method가 10문제를 푼 것과 대비된다(Trinh and Luong, 2024; Trinh et al., 2024). 핵심은 대형언어모델(LLM)만으로 증명을 써낸 것이 아니라는 점이다. 언어모델은 보조점, 보조선 같은 유망한 구성을 제안하고, 기호 추론 엔진은 기하 규칙에 따라 참인 명제를 누적하며 증명을 확인한다. 이른바 neuro-symbolic 방식이다. 그 결과 출력은 사람에게 비교적 읽히는 기하 증명이면서도 컴퓨터로 검증 가능한 구조를 갖는다(Trinh and Luong, 2024; Trinh et al., 2024).
2024년에는 범위가 넓어졌다. DeepMind의 AlphaProof와 AlphaGeometry 2는 2024년 IMO 6문제 중 4문제를 풀어 28/42점을 얻었고, 이는 은메달권 점수였다(AlphaProof and AlphaGeometry Teams, 2024). AlphaProof는 Lean 형식 언어와 강화학습 기반 증명 탐색을 결합해 대수 2문제와 정수론 1문제를 풀었고, AlphaGeometry 2는 기하 1문제를 증명했다. 반면 조합론 2문제는 풀지 못했다(AlphaProof and AlphaGeometry Teams, 2024). 또 자연어 문제를 시스템이 이해할 수 있는 형식 언어로 사람이 먼저 번역해야 했으며, 일부 풀이에는 최대 사흘이 걸렸다. 인간 참가자의 4시간 30분 시험 조건과는 다른 환경이었다(AlphaProof and AlphaGeometry Teams, 2024).
2025년 이후에는 일반 목적 추론 모델도 IMO 수준에 접근했다는 발표가 나왔다. DeepMind는 Gemini Deep Think의 고급 버전이 2025년 IMO에서 6문제 중 5문제를 풀어 35/42점, 금메달권 성과를 냈고 IMO 채점진의 인증을 받았다고 발표했다(Luong and Lockhart, 2025). OpenAI도 실험적 추론 모델이 2025년 IMO에서 금메달권 성과를 냈다고 밝혔다는 보도가 나왔지만, Google의 경우처럼 공식 참가 및 IMO 인증 절차를 거쳤는지와는 구분해 읽어야 한다(Axios, 2025). 이후 arXiv에는 Gemini 2.5 Pro, Grok-4, GPT-5 등을 검증·개선 파이프라인에 얹어 2025년 IMO 6문제 중 5문제를 풀었다는 독립 연구도 공개됐다(Huang and Yang, 2025). 다만 이는 동료심사 전 논문이며, 모델 자체의 단독 능력과 프롬프트·검증 절차의 효과를 분리해야 한다.
수학 연구 보조 사례도 늘고 있다. AlphaTensor는 강화학습으로 행렬곱 알고리즘 탐색을 게임처럼 정식화해 특정 행렬 크기와 체에서 더 적은 곱셈을 쓰는 알고리즘을 찾았다(Fawzi et al., 2022). FunSearch는 LLM이 프로그램 후보를 만들고 자동 평가기가 걸러내는 방식으로 cap set 문제와 온라인 bin packing에서 새 구성을 보고했다(Romera-Paredes et al., 2024). 이들은 리만가설 같은 난제를 해결했다기보다, 찾기는 어렵지만 검증은 가능한 영역에서 AI가 탐색 파트너가 될 수 있음을 보인 사례다.
기술적으로는 세 흐름을 구분해야 한다. 순수 LLM은 자연어 풀이를 유창하게 생성하지만, 그럴듯한 거짓 증명, 즉 환각을 만들 수 있다. neuro-symbolic AI는 신경망의 제안 능력과 기호 규칙의 검증 능력을 결합한다. Lean 기반 형식 증명은 모든 추론 단계를 컴파일러가 확인하므로 엄밀하지만, 자연어 수학을 형식 언어로 바꾸는 병목이 크다(AlphaProof and AlphaGeometry Teams, 2024). 부등식 증명 벤치마크 IneqMath에서는 상위 모델도 최종 답 기준 성능과 단계별 엄밀성 평가 사이에 큰 차이를 보였고, o1조차 단계별 검증 기준 전체 정확도는 10% 미만으로 보고됐다(Sheng et al., 2025).
따라서 현재 성과의 의미는 제한적이면서도 중요하다. AI는 이미 계산 보조 도구를 넘어 증명 후보 생성자, 검증 도구, 탐색 파트너가 되고 있다. 그러나 올림피아드 문제는 구조화된 짧은 문제이며, 연구 수학은 정의를 새로 만들고 좋은 질문을 고르며 긴 이론적 맥락을 조직하는 작업이다. IMO 금메달권 성과가 곧바로 리만가설 해결을 뜻하지는 않는다. 더 타당한 해석은 AI가 인간 수학자를 대체한다기보다, 형식화·탐색·검증·반례 찾기 같은 수학 연구의 노동 분업을 바꾸고 있다는 것이다.
참고문헌
1. AlphaProof and AlphaGeometry Teams. 2024. “AI Achieves Silver-Medal Standard Solving International Mathematical Olympiad Problems.” Google DeepMind Blog. Accessed July 3, 2026. https://deepmind.google/blog/ai-solves-imo-problems-at-silver-medal-level/
2. Axios. 2025. “Google and OpenAI Are Vying for Top AI Mathlete.” Axios. Accessed July 3, 2026. https://www.axios.com/2025/07/21/openai-deepmind-math-olympiad-ai
3. Fawzi, A., M. Balog, A. Huang, T. Hubert, B. Romera-Paredes, M. Barekatain, A. Novikov, et al. 2022. “Discovering Faster Matrix Multiplication Algorithms with Reinforcement Learning.” Nature 610: 47-53. https://doi.org/10.1038/s41586-022-05172-4
4. Huang, Y., and L. F. Yang. 2025. “Winning Gold at IMO 2025 with a Model-Agnostic Verification-and-Refinement Pipeline.” arXiv. https://arxiv.org/abs/2507.15855
5. Luong, T., and E. Lockhart. 2025. “Advanced Version of Gemini with Deep Think Officially Achieves Gold-Medal Standard at the International Mathematical Olympiad.” Google DeepMind Blog. Accessed July 3, 2026. https://deepmind.google/blog/advanced-version-of-gemini-with-deep-think-officially-achieves-gold-medal-standard-at-the-international-mathematical-olympiad/
6. Romera-Paredes, B., M. Barekatain, A. Novikov, M. Balog, and P. Kohli. 2024. “Mathematical Discoveries from Program Search with Large Language Models.” Nature 625: 468-475. https://doi.org/10.1038/s41586-023-06924-6
7. Sheng, J., L. Lyu, J. Jin, T. Xia, A. Gu, J. Zou, and P. Lu. 2025. “Solving Inequality Proofs with Large Language Models.” arXiv. https://arxiv.org/abs/2506.07927
8. Trinh, T. H., and T. Luong. 2024. “AlphaGeometry: An Olympiad-Level AI System for Geometry.” Google DeepMind Blog. Accessed July 3, 2026. https://deepmind.google/blog/alphageometry-an-olympiad-level-ai-system-for-geometry/
9. Trinh, T. H., Y. Wu, Q. V. Le, H. He, and T. Luong. 2024. “Solving Olympiad Geometry without Human Demonstrations.” Nature 625: 476-482. https://doi.org/10.1038/s41586-023-06747-5
자연과학대학 학생기자단 자:몽 박준영 기자 ezypuz@snu.ac.kr
카드뉴스는 자:몽 인스타그램 @grapefruit_snucns에서 확인할 수 있습니다.



