Learn.ai.kr
← AI 노트

OpenAI 수학 원고 722편, 검증된 것과 아닌 것 나눠 읽기

OpenAI가 2026년 10월 6일 내부 모델이 만든 수학 원고 722편을 공개했습니다. Lean 형식화 여부와 회사가 붙인 단서로 AI 산출물의 검증 상태를 나눠 읽는 방법을 정리했습니다.

최재현 · 2026.10.08

AI가 써 준 보고서를 받으면 어느 문장까지 믿고 어느 문장부터 다시 확인할지 정해야 합니다. OpenAI가 2026년 10월 6일 공개한 수학 연구 결과물은 이 판단을 연습하기 좋은 자료입니다. OpenAI는 공식 블로그 글 "Sharing AI progress in mathematics"에서 내부 프런티어 모델이 만든 새로운 수학 결과를 폭넓게 공개한다고 밝혔고, 같은 날 만든 GitHub 저장소 openai/math에는 원고 722편이 372개 묶음으로 정리돼 있습니다. OpenAI가 결과물마다 검증 단계가 다르다고 스스로 적어 둔 점도 눈여겨볼 만합니다. 이 사례를 따라가며 AI 산출물의 검증 상태를 나눠 읽는 방법을 정리했습니다.

1. OpenAI가 공개한 것과 공개하지 않은 것

저장소 README에 따르면 이 저장소에는 OpenAI 내부 모델이 만든 수학 원고와 증명 보조 자료가 들어 있습니다. 묶음 하나에는 중심 결과와 함께 보조 논증, 따름 결과, 다른 방식의 증명처럼 관련된 원고가 모여 있습니다. 저장소는 Apache-2.0 라이선스로 공개됐고, lean, preprints, reasoning_traces 폴더와 원고 목록(CONTENTS.md), 개요 문서(overview.pdf)가 있습니다.

공개된 것은 결과물뿐입니다. 결과를 만든 모델은 공개되지 않았고, 이 "내부 프런티어 모델"이 어떤 모델 계열인지도 공식 글에 적혀 있지 않습니다. OpenAI 한국어판 발표문은 결과 1건을 만드는 데 쓴 연산량이 평균적으로 ChatGPT Pro가 약 3시간 추론하는 데 쓰는 양에 해당한다고 설명했습니다. 이 수치는 회사가 자체적으로 환산한 값이고 제3자가 검증한 수치는 아닙니다.

README는 공개 배경도 밝혔습니다. OpenAI는 모델 개발 과정에서 미해결 연구 문제로 모델을 평가해 왔고, 기존 수학 평가에서 성능이 포화된 뒤 이 평가를 넓혔다고 적었습니다. 이 문장은 평가 방식에 대한 회사 설명이며, 공개된 원고가 어떤 난제를 풀었다는 뜻으로 읽으면 원문보다 나간 해석이 됩니다.

2. 회사가 직접 붙인 단서

README에는 이런 단서가 나옵니다(아래 인용은 작성자 번역). "이 모음에는 검증 단계가 서로 다른 결과가 들어 있고, 모든 결과에 Lean 형식화가 붙어 있지는 않다"는 문장과 "형식화되지 않은 결과 가운데 일부는 문제가 있을 수 있으며, 그런 문제는 빠르게 고치겠다"는 문장입니다. README는 Lean 형식화를 얻는 대로 저장소를 계속 갱신하겠다고도 적었습니다.

Lean은 수학 증명을 컴퓨터가 한 단계씩 검사할 수 있게 적는 언어입니다. Lean 검사를 통과했다면 증명의 각 단계를 컴퓨터가 확인했다는 뜻입니다. 형식화가 없는 원고는 이 확인을 아직 거치지 않았습니다. 따라서 722편 전체를 "증명이 끝난 결과"로 소개하면 회사 스스로 붙인 단서를 지우는 셈입니다.

발표 시점에 확인하지 못한 것도 있습니다. 722편 가운데 Lean 형식화가 끝난 비율과 목록, 외부 수학자의 독립 검증 결과, 형식화되지 않은 결과에서 실제로 오류가 발견됐는지는 공식 글에 나오지 않습니다. OpenAI가 밝힌 것은 문제가 "있을 수 있다"는 가능성까지입니다.

3. 검증 단계를 나눠 읽는 방법

Lean 형식화 여부와 외부 검토 여부로 AI 수학 원고를 4칸으로 나눠 읽는 매트릭스와 발표 시점에 확인하지 못한 항목

원고 722편과 372개 묶음, 일부 결과에만 Lean 형식화가 있고 형식화되지 않은 결과에 문제가 있을 수 있다는 내용은 OpenAI가 GitHub 저장소 README에 적은 사실입니다. 형식화 여부와 외부 검토 여부로 칸을 나눈 구성과 칸마다 적은 읽기 방법은 작성자 해석이며, 각 칸에 해당하는 원고 수는 확인하지 못했습니다.

작성자는 원고 하나를 볼 때 두 가지를 따로 확인하기를 권합니다. 하나는 기계 검사를 거쳤는지, 곧 Lean 형식화가 있는지입니다. 다른 하나는 만든 쪽이 아닌 사람이 검토했는지입니다. 둘 다 없는 원고는 흥미로운 가설로 읽으면 됩니다. Lean 형식화만 있는 원고는 증명 단계는 믿을 만하지만, 원래 문제를 Lean의 명제로 옮긴 정의가 맞는지는 사람이 대조해야 합니다. 두 확인을 모두 거친 원고만 출처, 버전, 검증 방식을 함께 적어 인용하는 편이 안전합니다.

4. 회사 업무의 AI 산출물에 옮겨 보기

수학 원고는 극단적인 사례이지만, 검증 단계를 나눠 읽는 습관은 시장 조사 요약이나 엑셀 분석 같은 업무 산출물에도 그대로 쓸 수 있습니다. 만든 회사가 검증 상태를 직접 나눠 공개했기 때문에 이 사례를 골랐습니다. 업무에서 받는 AI 산출물에는 이런 표시가 거의 붙어 있지 않으니, 받는 사람이 같은 질문을 대신 던져야 합니다.

점검 항목 openai/math 저장소에서 볼 곳 업무 산출물에서 볼 곳
기계로 검사했는가 lean 폴더에 그 결과의 형식화가 있는지 숫자와 수식을 원자료와 자동 대조했는지
만든 쪽이 밝힌 한계 README의 "문제가 있을 수 있다" 문장 보고서에 적힌 가정과 미확인 항목
독립 검토 외부 수학자 검토 결과(발표 시점 확인 못 함) 작성자 외 담당자가 검토했는지
과정 기록 reasoning_traces 폴더 근거 링크와 작업 기록

표의 오른쪽 열은 작성자가 업무 상황에 맞춰 옮긴 예시입니다. 교육 담당자라면 이 표를 그대로 교육 자료의 점검표로 써도 됩니다. 수강생에게 "AI 결과를 검증하세요"라고만 말하면 무엇을 해야 할지 알기 어렵지만, 칸을 하나씩 채우게 하면 검증이 구체적인 행동이 됩니다.

5. 이번 주에 해 볼 첫 단계

이번 주 팀에서 AI로 만든 문서 1건을 고르십시오. 그 문서의 주장마다 "원자료와 대조함", "다른 사람이 검토함", "아직 확인 안 함" 가운데 하나를 표시합니다. "아직 확인 안 함"이 붙은 문장은 보고서에 그대로 두되 확인 전이라고 밝히거나 빼면 됩니다. 교육을 준비 중이라면 openai/math 저장소의 README 첫 부분을 함께 읽으며, 회사가 스스로 붙인 단서 문장을 수강생이 직접 찾아보게 하는 활동으로 시작해 보십시오.

참고한 자료