인공지능
OpenAI이 수학 원고 722편을 공개했다. 자문을 구한 그 기구는 일주일 전 그만하라고 말했다
OpenAI이 10월 6일, 이름을 밝히지 않은 사내 모델이 만든 372개 결과 패밀리, 원고 722편을 공개했다. 회사가 꾸린 자문 그룹이 프런티어 연구소들에게 고급 수학 문제를 비공개 모델로 시험하는 일을 그만두라고 요청한 지 7일 뒤다. 이번 공개는 권고 일부를 지켰고, 일부를 미뤘고, 저장소와 모델과 문제 선정은 연구소 손에 남겼다.
MAI
OpenAI이 10월 6일 수학 원고 722편을 공개했다. 372개 결과 패밀리로 정리돼 있고, 만들어낸 것은 회사가 이름을 밝히지 않은 사내 모델이다. 원고는 회사가 소유한 GitHub 저장소에 놓여 있다. 그 7일 전, OpenAI이 직접 소집한 자문 그룹은 바로 이런 공개를 위한 권고를 발표했고, 그 첫머리에서 연구소들에게 그만하라고 요청했다.
현재 일부 프런티어 AI 연구소는 더 넓은 과학 공동체가 접근할 수 없는 비공개 모델로 고급 수학 문제를 시험하고 있다. 우리의 권고는 이 실무적 맥락을 염두에 두고 작성됐다. 그러나 이상적으로는 그러지 않아야 한다. 처음부터 분명히 말하고 싶다. 우리는 이 관행을 지지하지 않으며, 고급 수학 문제를 비공개 모델로 시험하는 일을 그만두라고 요청한다.
이것이 이번 일의 틀이다. OpenAI이 권고를 무시한 것은 아니다. 몇 가지는 지켰고, 세부까지 응한 것도 있다. 다만 첫 번째 항목은 공개한다는 행위 자체로 거절했다.
무엇이 공개됐나
| 항목 | OpenAI이 밝힌 수치 |
|---|---|
| 원고 | 722편 |
| 결과 패밀리 | 372개 |
| 평가 과정에서 모델에 제시한 문제 | 약 4,000개 |
| 결과 하나당 평균 연산량 | ChatGPT Pro 사고 3시간 상당 |
| Lean 형식화 | "많은 원고, 그러나 전부는 아님" |
| 공개된 추론 요약 | 10개 패밀리, 축약본 |
| 모델 | "공개되지 않은 OpenAI 사내 모델" |
저장소가 스스로 붙인 단서는 인용할 값어치가 있다. 거기가 정직한 부분이다. "형식화되지 않은 결과 일부에는 문제가 있을 수 있다. 그런 문제는 신속히 고치도록 노력할 것이다."
체크리스트에 대고 채점하기
자문 그룹의 9월 29일 문서는 600건이 넘는 설문 응답을 토대로 했고, 채점이 가능할 만큼 구체적이다.
| 그룹이 요청한 것 | 이번 공개가 한 것 |
|---|---|
| 결과를 "어떤 AI 연구소도 통제하지 않는" 학술 저장소에 둘 것 | github.com/openai/math에 공개. OpenAI은 "커뮤니티가 호스팅하는 저장소를 검토 중"이라고 밝힘 |
| 모델명, 프롬프트, 소요 시간, 추정 연산 비용을 공개할 것 | 연산량은 Pro 시간 평균으로 공개. 모델명은 비공개. 프롬프트는 미공개, 대신 추론 요약 10편의 축약본 |
| 증명을 가능한 한 형식화할 것 | 많은 수를 Lean으로 형식화, 전부는 아님 |
| 각 증명을 수학 논문의 관례에 맞게 다시 쓰고 관련 문헌을 인용할 것 | 미룸. OpenAI은 향후 공개에서 인용과 서술을 개선하겠다고 약속 |
| 비슷한 난도의 문제를 몇 개나 실패했는지, 문제를 어떻게 골랐는지 공개할 것 | 실패 기저율은 사실상 공개. 선정 기준은 제시되지 않음 |
| 공동체의 이해를 통제하지 않으면서 재정적으로 지원할 것 | OpenAI은 워크숍, 학회, 특별 프로그램에 자금을 대겠다고 밝힘 |
지킨 것 하나, 부분적인 것 셋, 지키지 않은 것 둘. 그리고 포괄적인 요청은 공개한다는 행위 자체로 거절됐다. 이 사안에 대한 회사의 종전 공개가 '숫자가 하나 들어간 문장'이었음을 생각하면, 이것은 실제 진전이다. 동시에 그룹이 요청한 것도 아니며, 간격은 늘 같은 자리에 있다. 산출물과 모델과 문제 선정을 연구소가 계속 쥐고 있다는 점이다.
새로운 것은 분모다
이번 공개에서 가장 쓸모 있는 숫자는 고백처럼 보이는 쪽이다. 약 4,000개 문제가 들어가서, 충분히 중요하다고 판단된 결과가 372개 패밀리 나왔다. 미해결 연구 문제에 대해 자기 기저율을 공개한 연구소는 지금까지 없었다. 그리고 기저율이야말로 머리기사의 건수를 능력 추정치로 바꿔주는 것이다. 4,000번의 시도에서 372개 패밀리를 푸는 모델은, 400번에서 372개를 푸는 모델과 전혀 다른 도구다.
연산량의 의미도 달라진다. 결과 하나당 Pro급 사고 3시간, 그런 규모의 평가라면 전체는 프런티어 추론 1만 시간을 넘는 영역에 들어간다. 수학자 한 사람의 경력에 비하면 싸고, 연구비에 비하면 비싸다. 미해결 문제를 힘으로 탐색해 공략하는 일의 경제성이 이제 눈에 보이게 됐다. 그리고 그것은 터무니없는 액수가 아니다.
무엇이 주장되었는가, 정확히
여기서는 열의보다 정확성이 필요하다. 머리기사의 숫자들이 오독을 부르기 때문이다.
표준 절차 밖에서 얻어진 두 건은 리만 제타 함수의 영점 없는 영역과, CM 아벨 다양체에 대한 호지 추측의 증명이다. 둘 다 밀레니엄 상 문제의 해결이 아니다. Re(s) > 11/12 반평면에서의 영점 없는 영역이라면 해석적 정수론에서 상당한 진전일 것이다. 그러나 리만 가설이 요구하는 것은 모든 비자명 영점이 Re(s) = 1/2 직선 위에 있다는 것이고, 영역은 직선이 아니다. CM 아벨 다양체에 대한 호지 추측은 추측의 특수한 경우이며, 추측 자체가 아니다. OpenAI은 또한 11/12 결과의 작성이 가독성을 위해 사람 손으로 편집됐다고 적었다. 카탈로그 안에서 본문에 사람의 관여가 인정된 유일한 지점이다.
이름이 밝혀진 추론 요약들은 나머지의 성격을 잘 보여준다. π의 무리수 지수, 대칭 및 일반 말러 추측, 표수 2에서 카플란스키의 직유한성 추측, 희박 스핀 글라스에 대한 메자르–파리시 공식, 3차원 상대론적 블라소프–맥스웰 계. 모두 실재하는 문제이고, 각 분야 깊은 곳에 있으며, 분야 밖에서는 대체로 유명하지 않다. Scientific American의 조지프 하울렛 기자는 결과의 거의 전부가 하나의 에이전트에게 건네진 하나의 프롬프트에서 나왔고, 일부는 여러 번의 시도를 요했을 수 있다고 보도했다.
읽기
검증 부담이 옮겨졌다. 쟁점은 애초에 산수가 아니라 그쪽이었다. Lean은 이 묶음의 일부를 덮는다. 남는 것은 다른 일자리를 가진 심사자를 기다리는 722편의 PDF다. OpenAI은 분야가 따라잡도록 워크숍에 돈을 대겠다고 약속했다. 합당한 제안이고, 동시에 분야가 스스로는 따라잡을 수 없다는 인정이기도 하다.
9월에 자문 그룹이 답하기 위해 만들어진 질문—결과가 숫자와 날짜로 나올 것인가, 아니면 수학자가 쓸 수 있는 형태로 나올 것인가—에는 이제 부분적인 답이 있다. 증명과 분모와 단서를 달고 나왔다. 동시에 연구소 이름이 붙은 저장소에서, 이름이 전혀 없는 모델로부터 나왔다. 아홉 명의 수학자가 그 둘 다를 요청하지 않은 일주일 뒤에.
Sources: OpenAI: Sharing AI progress in mathematics · openai/math on GitHub · Advisory Group on Mathematics and AI: General recommendations, September 29 · Advisory Group on Mathematics and Artificial Intelligence · Scientific American: OpenAI unleashes hundreds more math results upon a field already in shock · Interesting Engineering: OpenAI's largest math release tackles 4,000 problems with Lean proofs