AI Research Blog/Operational Einstein TestFrontier Mathematics · Scientific-System Intelligence · 2026-09-09
Einstein Test Research WatchOpen Problem DiscoveryMulti-Agent ScienceLean Verification

문제를 푼 AI보다, 문제를 고르고 검증까지 닫는 AI가 다음 시험이다

From Frontier Open Problems to Scientific-System Intelligence: Navier–Stokes and the Next Operational Einstein Test

Editorial Abstract

이번 업데이트에서 새롭게 보고할 만한 중대한 변화는 한 건이다. Einstein Test 자체의 새 공식 benchmark 버전은 확인되지 않았지만, AI multi-agent system이 실제 frontier open mathematical problem에 대해 새로운 analytic construction을 만들고 machine-checkable Lean artifact까지 공개했다는 사건은 지금까지의 Operational Einstein Test 논의를 훨씬 구체적인 시스템 문제로 바꾼다.

첨부 자료에 따르면 OpenAI는 훈련 중인 내부 모델과 대규모 coordinating-agent system을 이용해 3차원 incompressible Navier–Stokes 방정식의 smooth forcing 조건에서 finite-time singularity가 존재한다는 166쪽 증명을 공개했다. 그러나 이것을 곧바로 “Navier–Stokes Millennium Problem이 공식 해결됐다”거나 “AGI가 증명됐다”라고 부르면 증거 범위를 넘어선다. 문제와 자원배분은 인간이 제공했고 temporal isolation이 없었으며 cached Internet 접근도 있었다. 수학 공동체와 Clay Mathematics Institute의 독립적 인정도 아직 끝나지 않았다.

Evidence Boundary

이 글은 첨부된 Einstein Test-Trends-0909-2.md 전체를 1차 출처로 재구성한다. 첨부 자료가 인용한 OpenAI 공식 발표, Lean 저장소, Nature 보도를 링크로 유지하되 이 글에서 별도의 독립 수학검증을 수행하지 않는다. 따라서 “해결됐다”가 아니라 “해결한다고 주장하는 analytic proof와 Lean formalization이 공개됐다”는 표현을 사용한다.

Final Analytic Artifact
166 pages

OpenAI가 공개했다고 첨부 자료가 정리한 Navier–Stokes 증명 문서 규모.

Search Horizon
≈ 88 h

첫 실행 후 최종 Navier–Stokes 결과가 나온 시간으로 보고된 값.

Peak Parallelism
≈ 10K

최대 concurrent agents 규모.

Search Communication
2.7M / 130B

약 270만 메시지와 1,300억 output tokens.

Part I · One Major Change

새 benchmark보다 강한 것은 실제 미해결 문제에서 나온 사건이다

이번 확인은 기존 TruthInsightBench, Molecular Déjà Vu, SCILAWS-BENCH의 경미한 업데이트를 반복하지 않고 OpenAI의 9월 8일 발표 한 건에 집중한다.

§1 · Why This Event Matters

재현 benchmark가 아니라 frontier open-problem claim이다

첨부 자료는 이번 사건을 현재까지 추적한 사례 중 Einstein Test와 가장 가까운 실제 frontier open-problem discovery 사건 중 하나로 평가한다. 이미 알려진 논문을 다시 재현하는 것이 아니라, 공개적으로 미해결 상태였던 수학 문제에 대해 새로운 analytic construction을 만들고 formal certificate까지 제시했다는 점 때문이다.

하지만 강한 Einstein Test의 pass로 볼 수는 없다. 문제 자체는 인간이 제공했고, historical/temporal isolation이 없었으며, cached Internet 접근과 인간의 연구방향·자원배분이 있었다. 따라서 이번 결과가 강하게 지지하는 것은 Problem Discovery가 아니라 Hypothesis/Theory Construction → Adversarial Search → Formal Verification 쪽이다.

Part II · The Navier–Stokes Claim

OpenAI가 공개한 것은 “해결 인정”이 아니라 강한 해결 주장과 formal artifact다

무엇이 실제로 주장되었는지를 정확히 분리해야 이 사건의 연구적 의미를 과장 없이 읽을 수 있다.

§2 · Source-Reported Mathematical Claim

smooth forcing 아래 finite-time singularity를 구성했다고 주장한다

첨부 자료에 따르면 OpenAI는 GPT-6 Astra보다 “significantly more capable”하다고 설명한 훈련 중인 내부 모델과 대규모 coordinating-agent system을 이용해 3차원 incompressible Navier–Stokes equation에서 smooth forcing하에 finite-time singularity가 존재한다는 166쪽 증명을 공개했다.

논문의 정리 1.1은 모든 양의 viscosity에 대해 bounded kinetic energy를 유지하면서 velocity가 finite time에 unbounded해지는 해를 구성하며, Clay 문제의 alternatives C와 D를 충족한다고 주장한다.

Source Fact

이 문장은 첨부 자료가 OpenAI 공식 발표와 166쪽 proof PDF를 근거로 요약한 주장이다. 이 글은 수학적 정당성을 독립적으로 확인하지 않는다.

§3 · Formal Artifacts

Navier–Stokes와 Euler 결과가 Lean 4 저장소로 공개됐다

공개 GitHub 저장소에는 Navier–Stokes와 Euler 결과의 Lean 4 formalization이 함께 제공되며 별도의 independent checking 절차도 명시되어 있다고 첨부 자료는 정리한다. 특히 Navier–Stokes formalization은 whole-space \(\mathbb{R}^3\)와 periodic torus 두 경우를 각각 Clay statement의 C·D에 대응시킨다.

Part III · The 10K-Agent Scientific Search Organization

발견의 단위는 단일 LLM이 아니라 거대한 병렬 연구조직에 가깝다

이 사건은 model capability보다 scientific search organization의 구조를 함께 봐야 한다는 강한 근거를 제공한다.

§4 · Before Navier–Stokes

약 100개 agent가 Euler regularity의 disproof를 먼저 탐색했다

OpenAI의 설명을 첨부 자료가 정리한 바에 따르면, 9월 1일부터 여러 Millennium Prize Problem과 관련 문제를 평가하고 문제별 여러 agent group을 병렬 실행했다. Navier–Stokes로 집중하기 전에는 약 100개 agent가 약 50시간 협력해 unforced Euler regularity problem의 disproof를 먼저 얻었다.

그 결과는 이후 Navier–Stokes agent들에게 전달되었고, 여러 접근법의 중간 결과를 교차 통합하는 데 사용되었다. 즉 각 agent가 고립된 독립 샘플을 생성한 것이 아니라 shared intermediate knowledge를 축적하고 재사용하는 연구조직으로 작동했다.

§5 · Scale of the Final Search

88시간, 최대 10,000 agent, 270만 메시지, 1,300억 output token

최종 Navier–Stokes 결과는 첫 실행 후 약 88시간 만에 나왔으며, 해당 작업에는 최대 약 10,000개의 concurrent agents, 약 270만 개 메시지, 약 1,300억 output tokens가 사용됐다고 보고되었다. 이후 GPT-6 Astra를 이용한 Lean formalization·verification에 추가로 약 17시간이 들었다.

Parallel Search
~10K

여러 접근을 병렬로 탐색하는 최대 concurrent agent 규모.

Shared Traffic
~2.7M

agent 간 메시지 규모. 중간지식 교환이 시스템의 일부였다.

Formalization
~17 h

GPT-6 Astra를 사용한 Lean formalization·verification 추가 시간.

Analysis

이 수치는 “한 모델이 88시간 생각했다”는 뜻이 아니다. 더 정확한 해석은 대규모 parallel search + shared memory + tool use + human allocation + formal verifier가 결합된 하나의 scientific computing organization이 작동했다는 것이다.

Part IV · Verification Boundary

Lean certificate가 있어도 수학 공동체의 독립 검토는 별도 단계다

machine-checkable verification과 scientific acceptance는 연결되지만 같은 절차가 아니다.

§6 · What Can Be Said Now

가장 정확한 표현은 “해결한다고 주장하는 증명과 Lean formalization을 공개했다”이다

첨부 자료는 이 경계를 가장 중요하게 강조한다. OpenAI가 공개한 것은 강력한 해결 주장과 Lean formalization이지, 수학 공동체와 Clay Mathematics Institute가 최종적으로 문제 해결을 인정했다는 의미가 아니다.

Nature 역시 이를 “OpenAI claims”로 보도하고 있고 독립적인 수학적 검토가 필요한 상태라고 자료는 정리한다. 공개된 Clay Mathematics Institute 페이지도 여전히 일곱 문제 중 Poincaré Conjecture만 해결된 것으로 기술하며, OpenAI 스스로 이번 결과에 대해 Millennium Prize를 청구하지 않겠다고 밝혔다.

Do Not Overclaim

현재 가장 정확한 표현은 “AI multi-agent system이 Navier–Stokes Millennium Problem의 C/D를 해결한다고 주장하는 analytic proof와 machine-checkable Lean formalization을 공개했다”이다.

§7 · Verification Ladder

발견에서 formalization, machine checking, 인간 검토로

\[\text{Discovery}\rightarrow\text{Formalization}\rightarrow\boxed{\text{Machine-Checkable Verification}}\rightarrow\text{Independent Human Validation}\]

기존 autonomous scientist benchmark가 novelty나 correctness를 LLM judge 또는 인간 평가에 크게 의존했다면, 이번 사례는 수학·이론과학 트랙에서 최종 claim을 formal proof artifact로 변환하고 deterministic verifier를 통과시키는 단계가 실제 평가요건이 될 수 있음을 보여준다.

Part V · Model Intelligence vs Scientific-System Intelligence

Operational Einstein Test의 평가 단위가 바뀌어야 한다

이번 결과를 단일 모델 점수로 설명하면 발견을 만든 실제 시스템의 중요한 부분이 사라진다.

§8 · Historical Question

기존 질문은 Historical Knowledge에서 Transformative Discovery로의 도약이었다

\[\text{Historical Knowledge}\rightarrow\text{Transformative Discovery}\]

Einstein Test의 전통적 직관은 과거 지식만 가진 AI가 미래의 역사적 발견에 해당하는 결과를 재구성할 수 있는가를 묻는 것이다. 이 framing은 여전히 중요하지만, 실제 frontier open-problem 사례는 연구단위가 훨씬 복잡하다는 점을 드러낸다.

§9 · The Real Cognitive Unit

모델 하나가 아니라 frontier model + 10K agents + shared knowledge + tools + humans + verifier

\[\begin{aligned}\text{Scientific-System Intelligence}\approx{}&\text{Frontier Model}+\text{10K-Agent Search}\\&+\text{Shared Intermediate Knowledge}+\text{Code/Internet Tools}\\&+\text{Human Resource Allocation}+\text{Formal Verifier}\end{aligned}\]

첨부 자료는 이 때문에 향후 Einstein Test가 최소한 Model Intelligence와 Scientific-System Intelligence를 분리 측정해야 한다고 본다. 이번 결과는 단일 모델이 독립적으로 “아인슈타인식 통찰”을 얻은 사건이라기보다, 거대한 병렬 scientific search organization이 하나의 인지시스템처럼 작동한 사례에 가깝다.

LayerWhat should be measured separately?
Model intelligence개별 모델의 theory construction, mathematical reasoning, local proof search 능력
Search organization병렬 탐색의 다양성, 중복 제거, 경쟁 접근법의 유지와 통합
Shared memory중간 결과를 얼마나 정확히 저장·검색·전파·재사용하는가
Tool intelligencecode, Internet, theorem prover, formalization tool의 선택과 사용
Human contribution문제선택, 방향설정, budget allocation, escalation에서 인간이 제공한 정보량
Verification layerformal certificate의 완전성, independent checking, human validation
Part VI · Einstein Test Scorecard

강한 증거가 있는 단계와 아직 비어 있는 단계를 동시에 표시해야 한다

이 사건은 full pass가 아니라 capability profile로 읽는 편이 정확하다.

§10 · Capability Profile

Problem Formulation과 Temporal Isolation은 약하고, Theory Search와 Formal Verification은 강하다

Einstein-Test DimensionCurrent status in the reported caseInterpretation
Problem Formulation인간이 문제 제공AI가 연구문제 자체를 발굴했다고 볼 수 없음
Temporal Isolation없음historical rediscovery와 contamination-resistant discovery의 조건을 충족하지 않음
Problem Selection인간 개입 큼Millennium-class problem 중 무엇에 자원을 집중할지 인간이 결정
Abductive / Theory Search강한 증거open problem에 대한 새로운 analytic construction을 생성했다고 보고
Adversarial / Parallel Search강한 증거다수 agent와 접근법을 병렬 탐색·통합
Formal Verification매우 강한 증거Lean 4 certificate와 independent checking procedure 공개
Independent Validation현재 진행 중수학 공동체·Clay 인정과 동일하지 않음
§11 · What This Does Demonstrate

AGI 증명이 아니라 frontier open-problem candidate solution을 machine-verifiable artifact로 만드는 능력의 증거다

이번 결과를 “AGI가 증명됐다”라고 해석하는 것은 과도하다. 그러나 “AI가 인간 frontier의 open scientific/mathematical problem에서 독창적인 후보 해를 생성하고 machine-verifiable artifact까지 만들 수 있는가?”라는 질문에는 과거보다 훨씬 강한 실증적 답을 제공한다는 것이 첨부 자료의 평가다.

Part VII · The Next Operational Einstein Test

다음 시험은 “Navier–Stokes를 풀어라”라고 말해주지 않아야 한다

가장 어려운 단계는 주어진 문제를 푸는 것에서, 어떤 문제가 중요한지 스스로 발견하고 표현을 구성하는 것으로 이동한다.

§12 · The New Research Question

problem, approach, target이 주어지지 않아도 비슷한 급의 결과를 발견할 수 있는가

\[\boxed{\text{Can an AI system discover a comparable result}\;\mathbf{without}\;\text{the problem, approach, or target being supplied?}}\]

첨부 자료는 이번 업데이트를 반영하면 향후 Einstein Test의 가장 중요한 질문 중 하나가 이 방향으로 바뀔 가능성이 높다고 본다. 문제 해결 능력에서 문제 발견과 표현 구성 능력으로 평가의 중심이 이동하는 것이다.

§13 · A Stronger Test

미해결 현상 속에서 중요한 문제를 스스로 골라내고 증명·반증까지 닫는다

진짜 다음 단계의 Einstein Test는 “Navier–Stokes를 풀어라”라고 알려주는 시험이 아니다. 수많은 미해결 현상과 데이터 속에서 AI가 Navier–Stokes급 문제를 스스로 선택하고, 기존 표현이 부족하다면 새로운 representation과 principle을 만들고, 경쟁 가설을 제시하고, 증명 또는 반증을 완성하고, formal verifier와 독립 검토를 통과해야 한다.

Observeunresolved phenomena / data
Selectimportant problem discovery
Representnew concepts / formulation
Theorizeabductive construction
Challengeproof / refutation search
Verifymachine + human validation
§14 · Final Synthesis

이번 사건은 Einstein Test를 더 어렵게 만든 것이 아니라 더 정확하게 만들었다

과거에는 “아직 아무도 풀지 못한 문제를 AI가 풀면 AGI인가?”라는 질문이 매력적으로 보였다. 이번 사례는 그 질문이 너무 거칠다는 사실을 드러낸다. 강한 scientific-system은 인간이 문제를 주고 수천 agent와 막대한 compute를 배치하면 놀라운 frontier artifact를 만들 수 있다. 그러나 그것과 무엇을 발견할 가치가 있는지 스스로 알아내는 능력은 다르다.

다음 Operational Einstein Test의 핵심은 정답이 없는 문제를 푸는 것을 넘어, 문제가 아직 이름조차 얻지 못한 상태에서 중요한 문제를 찾아내고, 새로운 표현과 원리를 만들고, 반증과 검증을 거쳐 지식으로 확정하는 것이다.

Model intelligence and scientific-system intelligence must be measured separately
§15 · Key Takeaways

이번 업데이트를 여덟 문장으로 압축하면

01 · One major new event

Einstein Test의 새 공식 benchmark 버전보다 OpenAI의 Navier–Stokes open-problem claim이 더 중요한 신규 변화다.

02 · Not a final recognized solution

현재는 C/D를 해결한다고 주장하는 analytic proof와 Lean formalization이 공개된 상태이며 독립 검토가 남아 있다.

03 · Scientific search at scale

최대 약 10,000 agent, 270만 메시지, 1,300억 output token 규모의 병렬 scientific search organization이 작동했다.

04 · Shared knowledge mattered

Euler 결과와 여러 접근법의 중간 산출물이 Navier–Stokes 탐색에 전달·통합되었다.

05 · Formal verification strengthened

Lean 4 certificate 공개로 discovery → formalization → machine checking의 경로가 구체화되었다.

06 · Strong test still incomplete

problem formulation, temporal isolation, problem selection에서 인간 의존이 크다.

07 · New measurement unit

Einstein Test는 model intelligence와 scientific-system intelligence를 분리해야 한다.

08 · The next frontier

AI가 문제·접근·target을 공급받지 않고도 comparable discovery를 스스로 찾아내는가가 다음 핵심 질문이다.

Source Reference Map

References

첨부 연구동향 문서가 직접 제시한 세 출처를 유지한다.

01
On the Navier–Stokes Millennium Prize Problem
OpenAI · 8 Sep 2026

내부 연구모델, 대규모 coordinating-agent search, Euler에서 Navier–Stokes로 이어지는 탐색과 compute 규모를 첨부 자료가 정리할 때 사용한 공식 발표.

02
NavierStokesAndEuler: Lean certificates accompanying Navier–Stokes and Euler results
OpenAI · GitHub

Navier–Stokes와 Euler 결과의 Lean 4 formalization과 independent checking 절차의 출처.

03
OpenAI claims huge maths breakthrough on a famed ‘Millennium Problem’
Nature · 2026

이번 결과를 “claim”으로 다루고 독립적 수학검토가 필요하다는 경계를 첨부 자료가 확인할 때 사용한 보도.