수학 시험은 챗지피티(ChatGPT), 클로드(Claude)와 같은 AI 모델의 능력을 평가하는 기준 방법이었습니다. 오픈에이아이(OpenAI)는 이제 자사 모델들이 너무 우수해져서 기존의 수학 시험이 점점 무의미해지고 있다고 밝혔습니다. 그래서 연구자들은 더 어려운 시도를 했습니다.
연구팀은 미공개 모델에 약 4,000개의 미해결 수학 문제를 제시했습니다. 결과는 놀라웠고 우려를 자아냈습니다.
AI는 722편의 논문을 작성했고, 이 논문들은 372개의 유사 결과군으로 묶였습니다. 오픈에이아이는 각 결과마다 평균 약 3시간의 추론 연산 과정을 거쳤다고 밝혔습니다.
“수학계에 아주 흥미로운 날이 찾아올 것입니다!” 라고 비인크립토(Future Tech and AI Experts Council) 위원 스테파노 고지오소(Stefano Gogioso)가 말했습니다.
AI가 너무 빠르게 강력해지고 있습니까?
이 점이 더 중요한 이슈입니다. 최첨단 AI는 이제 알려진 질문에 답하는 것을 넘어서 미지의 문제에 대한 잠재적 해답을 창출하기 시작했습니다.
이로 인해 연구원, 엔지니어, 분석가가 시도할 수 있는 지적 작업의 범위가 크게 늘어날 수 있습니다.
그러나 결과물이 진실인 것은 아닙니다. 오픈에이아이의 논문 중 다수는 컴퓨터로 검증 가능한 Lean 증명을 포함합니다. 그 외 논문은 그렇지 않습니다. 오픈에이아이는 일부 미검증 결과에 “문제가 있을 수 있다”고 경고합니다.
이로 인해 새로운 병목 현상이 나타납니다. 인간이 AI의 연구 생성 속도를 따라가며 검증하기 어렵게 될 수 있습니다.
AI가 이제 예측 분석과 투자 결정을 내릴 수 있습니까?
가능성은 있지만, 금융 분야는 다른 방식으로 더 어렵습니다.
수학적 증명은 정·오답 여부를 결국 입증할 수 있습니다. 금융시장은 복잡하고 끊임없이 변동합니다.
최근 금융 벤치마크들은 여전히 최첨단 AI가 복잡한 투자 연구에서 고전하고 있음을 보여줍니다. 시장 타이밍 연구에서도 예측력의 한계가 드러납니다.
가까운 시기에는 완벽한 예측보다는 심층 분석이 더 큰 기회가 될 것입니다.
수시간 동안 추론이 가능한 AI는 공시, 실적 발표, 거시경제 데이터, 경쟁 시나리오를 동시에 검토할 수 있습니다. 한 명의 분석가보다 훨씬 많은 가설을 검증할 수 있습니다.
이 점이 오픈에이아이의 실험에서 나타난 중요한 신호일 수 있습니다. AI는 이제 방대한 양의 진지한 분석 작업을 생산할 역량을 갖추기 시작했습니다. 다음 과제는 어떤 결과를 신뢰해야 하는지 결정하는 일입니다.









