KirinNews

OpenAI, 3천억 토큰 쏟아부어 수학 난제 증명… 학계는 '데이터 무단 도용' 반발

OpenAI, 3천억 토큰 쏟아부어 수학 난제 증명… 학계는 '데이터 무단 도용' 반발

Key Points

  • 1NYU 연구진이 코덱스와 클로드를 활용해 밀레니엄 수학 난제인 나비에-스토크스 방정식 증명에 다가서자, OpenAI가 자체 증명을 전격 발표했습니다.
  • 2OpenAI는 미공개 차세대 모델을 통해 3천억 토큰(약 2,250만 달러 비용)을 소모하며 단 일주일 만에 증명을 완료했습니다.
  • 3벅마스터 교수는 자신의 코덱스(Codex) 사용 기록이 OpenAI 모델의 학습 데이터로 사용되어 연구 아이디어가 유출되었을 가능성을 제기했습니다.
  • 4OpenAI 측은 사용자 데이터를 직접적으로 참조하지 않았으며 증명 내용에 차이가 있다고 반박했으나, 데이터 재사용의 위험성은 인정했습니다.
  • 5이번 사건은 프론티어 AI의 압도적인 추론 능력과 함께, AI 개발 도구 사용 시 발생할 수 있는 프롬프트 데이터 탈취 위험성을 시사합니다.
NYU 수학자 트리스탄 벅마스터가 AI를 활용해 밀레니엄 수학 난제인 나비에-스토크스 방정식 증명에 다가선 가운데, OpenAI가 이를 가로채듯 자체 증명을 발표해 논란이 일고 있습니다. OpenAI는 미공개 차세대 모델을 사용해 3천억 토큰(약 2,250만 달러 규모)을 소모하며 일주일 만에 증명을 완료했다고 밝혔으나, 학계에서는 기존 연구 데이터가 모델 학습에 무단 사용되었을 가능성을 제기하고 있습니다. 이번 사태는 AI의 수학적 추론 능력이 비약적으로 발전했음을 보여주는 동시에, 프롬프트 데이터의 무단 학습과 AI 기업의 연구 윤리 문제를 수면 위로 끌어올렸습니다.

NYU의 트리스탄 벅마스터(Tristan Buckmaster) 교수와 앤스로픽 소속 수학자 레벤트 알포게(Levent Alpöge)가 AI를 활용해 수학계 7대 난제 중 하나인 나비에-스토크스(Navier-Stokes) 방정식의 존재성과 매끄러움 문제에 대한 증명에 근접했다고 발표한 직후, OpenAI가 자체적으로 해당 난제를 완벽히 증명했다고 발표하며 심각한 윤리적 논란이 일고 있습니다. 밀레니엄 난제 해결이라는 수학계의 엄청난 진전 이면에 AI 모델 학습 데이터를 둘러싼 치열한 갈등이 숨어있습니다.

OpenAI는 블로그를 통해 자사의 미공개 차세대 모델이 나비에-스토크스 문제의 전체 증명을 완료했다고 공식화했습니다. OpenAI 측에 따르면, 이 성과를 달성하기 위해 연구팀은 일주일 동안 무려 3,000억 개의 출력 토큰을 소모했으며, 이는 현재 Astra 모델의 API 요금 기준으로 약 2,250만 달러(한화 약 300억 원)에 달하는 막대한 컴퓨팅 비용입니다. 단순한 지시(Prompt)만으로 며칠 만에 도달할 수 있는 성과가 아니라는 점에서, AI의 진화된 수학적 추론 능력을 보여주는 극단적인 사례로 평가받고 있습니다.

그러나 벅마스터 교수는 OpenAI의 연구 과정과 윤리성에 강한 의혹을 제기했습니다. 벅마스터 팀은 연구 과정에서 OpenAI의 Codex 모델을 주요 도구로 활용했는데, OpenAI가 이들의 작업 내용을 파악한 후 컴퓨팅 자원의 우위를 앞세워 증명을 가로챘다는 것입니다. 특히 벅마스터가 선택한 특정 수학적 접근법(smooth force)이 학계에서 극히 드문 방식이었음에도 불구하고 OpenAI가 동일한 방향을 채택했다는 점은 이러한 의구심을 증폭시키고 있습니다. OpenAI는 사용자의 Codex 인터랙션 데이터를 모델 학습에 활용할 수 있는 권리를 명시하고 있어, 사용자의 프롬프트 데이터가 AI의 자율 연구에 재사용(Regurgitation)되었을 가능성이 제기됩니다.

이에 대해 OpenAI 측은 벅마스터 팀의 연구를 직접적으로 참고한 바가 없으며, 자사의 증명은 오일러 강제/비강제 케이스에서 구체적인 결과가 다르다고 해명했습니다. 그러나 익명화된 사용자 데이터가 모델 성능 향상에 기여했을 가능성은 완전히 배제하지 않았습니다. 이번 사태는 초대형 AI 모델이 전례 없는 과학적 발견을 주도할 수 있다는 사실을 증명함과 동시에, 엔지니어와 연구자들이 AI 도구 사용 시 직면할 수 있는 지식재산권 및 데이터 프라이버시 탈취의 실질적 위험을 경고하고 있습니다.

다른 소식들