필즈상 수상자 25인, AI 기업들이 미해결 문제를 벤치마크로 오용해 수학을 ‘파괴’한다고 경고
필즈상 수상자 25인이 공동 성명에 서명하며 OpenAI를 포함한 주요 AI 기업들이 미해결 수학 문제를 성능 벤치마크로 남용하고 있다고 비난했다. 이들은 이러한 관행이 수학 연구의 진실성과 기계 지능에 대한 대중의 이해를 모두 훼손할 위험이 있다고 주장한다.
핵심 논쟁
문제는 AI 연구소들이 리만 가설부터 오랜 조합론적 추측에 이르기까지 유명한 미해결 문제에 대한 결과를 내세워 모델 능력을 과시하는 경향이 커지고 있다는 점이다. 서명자들은 AI 시스템이 그러한 문제에 대해 부분적이거나 발견적(휴리스틱) 출력을 생성하고 이것이 돌파구로 포장될 때 왜곡된 피드백 루프가 생긴다고 주장한다. 즉, 벤치마크에 맞춰 최적화가 이루어지고, 자금은 헤드라인을 장식하는 데모로 흘러가며, 진정한 수학적 엄밀성은 밀려난다.
이 논란에 독점적으로 응한 한 필즈상 수상자는 상황을 범주 오류라고 표현했다. 수학은 리더보드가 아니라고 이 인물은 주장했다. 문제가 미해결인 이유는 깊은 구조적 질문을 담고 있기 때문이지, 아무도 충분한 컴퓨팅을 투입하지 않았기 때문이 아니다. 그것들을 벤치마크 목표로 취급하는 것은 지도와 영토를 혼동하는 것이며, AI가 실제로 무엇을 할 수 있는지에 대해 정책 입안자, 투자자, 대중을 오도한다.
AI-암호화폐 접점에 중요한 이유
이 논쟁은 암호화폐와 AI의 융합 한가운데에 자리한다. 탈중앙화 컴퓨팅 네트워크, AI 에이전트 프로토콜, 모델 토큰화 플랫폼은 점점 더 ‘벤치마크 성능’을 마케팅하며, 종종 수학 및 추론 점수를 유용성의 증거로 인용한다. 학계가 이러한 벤치마크의 타당성을 공식적으로 거부한다면, AI-암호화폐 부문의 상당 부분에 대한 마케팅 기반이 약화된다.
- 탈중앙화 컴퓨팅 네트워크로 프런티어 모델의 훈련이나 추론을 광고하는 곳은 능력 주장을 어떻게 검증하는지에 대해 더 엄격한 조사를 받을 수 있다.
- AI 에이전트 토큰으로 가치 제안이 ‘추론 벤치마크’에 의존하는 것은 신뢰성 침식을 겪을 수 있다.
- 데이터 마켓플레이스로 수학 또는 과학 데이터셋을 판매하는 곳은 품질을 어떻게 인증할지 재고해야 할 수 있다.
미래 지향적 관점
이 성명이 AI 연구소들이 수학 문제를 평가 대상으로 사용하는 것을 막을 가능성은 낮다. 벤치마크는 상업적으로 너무 유용하기 때문이다. 그러나 그것은 분열을 가속화할 수 있다. 한쪽에는 엄밀하고 동료 검토를 거친 평가 기준, 다른 쪽에는 마케팅 주도 벤치마크 문화. 암호화폐-AI 프로젝트에게 현명한 움직임은 전자에 맞추는 것이다. 검증 가능한 컴퓨팅, 투명한 평가 방법론, 모델 출력의 온체인 증명은 진정한 차별화 요소가 될 수 있다. 규제 당국이 요구해서가 아니라, 학계의 반발이 검증 불가능한 주장을 점점 더 비용이 많이 들게 만들기 때문이다.
필즈상 수상자들이 제기하는 더 깊은 질문은 철학적이다. 만약 AI의 가치가 완전히 해결할 수 없는 문제로 측정된다면, 벤치마크 포화에 대한 업계의 집착은 전혀 잘못된 것을 측정하고 있을지도 모른다.




