기억한 정답을 넘어
새 법칙을 찾는가
Einstein Test Update: ExplorationBench and Scientific Impact
학습 이후의 발견을 맞히는 시간격리 테스트에, 익숙한 세계의 법칙을 뒤집고 직접 탐색하는 평가가 더해졌다. 좋은 아이디어의 후속 영향력은 또 다른 질문을 던진다.
이번 추적은 공식 Einstein Test의 새 버전을 확인한 것이 아니다. 9월 24일 공개된 두 연구가 과학적 발견의 평가를 어떻게 정교하게 만들 수 있는지 검토한다. 성능의 최고값과 반복 신뢰도, 잠재적 영향력과 실제 미래 성과를 분리한다.
원자료: Einstein Test-Trends-0926.md. 브리핑 업데이트 기준일 2026-09-26; 두 연구의 arXiv 공개일 2026-09-24.
전체 목차
공식 프로토콜의 상태와 이번 업데이트
이전 실행 이후 공개 자료를 다시 점검한 첨부 브리핑은 중복 연구, 단순 리더보드 이동, 경미한 개정을 제외하고 의미 있는 신규 업데이트 두 건을 골랐다. 하나는 학습된 상식과 충돌하는 세계에서 규칙을 발견하도록 하는 ExplorationBench, 다른 하나는 학술적 후속 영향을 아이디어 생성의 학습신호로 사용하는 연구다.
직접적인 Einstein Test 또는 Singularity Gate 공식 프로토콜의 신규 버전은 이 브리핑에서 확인되지 않았다. Singularity Gate의 공개 버전 이력상 최신 표기는 v1.1, 2026년 7월 15일이다. 이 글의 두 연구는 공식 테스트 개정으로 취급하지 않고, 향후 평가 설계에 주는 시사점으로 읽는다. 버전 이력 확인
Singularity Gate v1.1
모델 학습 시점 이후의 실제 과학 발견을 이용해 시간적 학습오염을 줄인다.
두 신규 연구
반상식적 규칙을 스스로 탐색하는 능력과 아이디어의 후속 영향력이라는 서로 다른 평가축을 제안한다.
게시일 2026-09-26은 첨부 파일명 “0926”의 브리핑 업데이트 기준일이다. 두 사전논문의 arXiv 공개일은 모두 2026년 9월 24일이다.
익숙한 지식이 통하지 않는 외계 세계
ExplorationBench: Measuring AI Systems’ Exploration in Verifiable Alien Worlds는 Ming Zhang, Zhenghao Xiang, Peizhong Gao 등 20명의 연구진이 2026년 9월 24일 공개한 arXiv v1이다. 첨부 자료는 Fudan University, Tencent Hunyuan Team, Tsinghua University의 참여를 기록한다. 핵심 질문은 새 규칙을 발견했는가, 학습 중 본 유사한 지식을 떠올렸는가이다. 논문 원문
연구진은 규칙을 실행해 정답을 정확하게 확인할 수 있으면서도 인간에게 익숙한 의미와 의도적으로 충돌하는 두 세계를 만든다. AlienCode는 프로그램 의미의 변형을, AlienLogic은 논리 규칙의 변형을 탐색한다. 두 환경을 합치면 55개 발견 목표와 140개 별도 평가 과제이며, 논문 초록은 각각 31개 목표·70개 과제와 24개 목표·70개 과제로 나눈다.
- 잘못된 초기 설명서와 일부 예제를 받는다.
- 모델이 어떤 질문을 던질지 스스로 정하고 도구를 이용해 세계에 probe를 보낸다.
- 환경 피드백으로 가설을 수정하며 네 차례 탐색을 진행한다.
- 그 뒤 도구 없이 held-out 과제에 답한다. 학습한 규칙을 새로운 과제에 전이하는지 측정한다.
규칙이 학습 이전 상식과 충돌한다는 설계가 기억에 의존한 지름길을 약화한다. 동시에 실행 가능한 세계이므로 답의 검증은 명확하다. 다만 이 통제된 과제의 성취를 실제 새로운 과학 발견과 동일시하지 않는다.
탐색의 최고점과 반복 신뢰도
AlienCode에서 Claude Opus 5의 최고 독립 탐색 경로는 초기 3.8%에서 네 라운드 뒤 87.6%에 이르렀다. 같은 표에서 GPT-5.6 Sol의 해당 수치는 11.0%와 87.1%다. 이것은 단일 경로의 최고점인 Best@3이다. 세 경로의 평균 및 최저를 함께 보아야 안정성을 판단할 수 있다. 논문 결과표
| AlienCode 시스템 | 최고 경로 초기 | 최고 경로 4회 후 | 3개 경로 평균 | 최저 경로 |
|---|---|---|---|---|
| Claude Opus 5 | 3.8% | 87.6% | 72.5% | 49.0% |
| GPT-5.6 Sol | 11.0% | 87.1% | 78.6% | 72.9% |
연구진은 동일한 시스템의 독립 경로 사이 편차가 크고, 추가 탐색이 앞선 성과를 유지하지 못하는 사례도 보고한다. 환경 피드백 없이 같은 수의 모델 턴만 더 쓴 조건은 AlienCode에서 0.5–11.0%에 머물렀다. 따라서 점수 상승을 단순한 장시간 추론 효과로 환원하기 어렵다. 반대로 Best@3만으로 재현 가능한 발견이라고 판단할 수 없다.
평가 해석: 논문의 세 독립 trajectory는 시스템별 변동성을 드러내지만, 분포를 정밀하게 추정하기에는 적다. Einstein Test에 연결할 때 최고점과 별도로 반복 실행의 성공률·최저 성능·지식 유지 여부를 보고할 필요가 있다.
과학 아이디어의 후속 영향력을 배우다
Learning to Ideate for Scientific Impact는 Shubham Kale, Aniketh Garikaparthi, Manasi Patwardhan의 2026년 9월 24일 arXiv v1이며 ICML 2026 RLxF Workshop 연구다. 첨부는 TCS Research, India 소속을 명시한다. 새로운 아이디어의 참신함·명료성·실현 가능성처럼 당장 판정 가능한 proxy를 넘어, 나중에 과학계가 그 아이디어를 얼마나 채택했는가를 학습신호로 삼으려 한다. 논문 원문
10만 편이 넘는 컴퓨터과학 논문에서 연구목표–아이디어 쌍을 추출하고, 연도별로 정규화한 인용 영향력을 순서형 label로 만든다. 이를 예측하는 보상모델을 학습한 뒤, 지도 미세조정에 이어 강화학습으로 아이디어 생성기를 조정한다.
| 모델 | Majority-vote impact rate |
|---|---|
| 기본 모델 | 30.66% |
| SFT | 26.61% |
| Impact-aligned RL | 51.66% |
이 수치는 생성된 아이디어의 미래 실제 인용률이 아니다. 보류된 역사적 아이디어와 같은 연구목표 아래 비교하고, 평가 모델의 판단에 기준 아이디어의 인용 label을 반영한 대리평가다. 저자들이 보고한 성능 향상은 이 프로토콜 안에서 해석해야 한다. 인용도 분야 규모, 출판 관행, 사회적 관심의 영향을 받는 잡음이 있는 proxy다.
Operational Einstein Test의 네 축
두 연구는 Einstein Test의 공식 규칙을 바꾼 것이 아니다. 첨부 브리핑의 제안은 기존의 시간격리에 학습 사전정보와 충돌하는 숨은 법칙을 결합하는 것이다. 전자는 “발견 당시 알 수 없었던 후속 증거를 맞히는가”를, 후자는 “익숙한 답이 통하지 않을 때 직접 실험을 설계해 새 규칙을 알아내는가”를 겨냥한다.
이 결합에서 Temporal Isolation × Counter-Prior Novelty × Repeatable Exploration × Future Scientific Impact라는 네 평가축을 제안할 수 있다. 여기서 마지막 축은 당장 측정 가능한 인용 proxy와 구별한다.
반복 가능한 탐색
독립 trajectory의 변동성, probe 선택, 새 규칙의 설명과 도구 없는 전이를 함께 기록한다.
후속 검증과 파생 연구
독립 재현, 새 예측의 성공, 후속 연구를 여는 정도를 장기 결과로 추적한다.
이 연결은 편집자의 평가 설계 제안이다. 두 논문 모두 역사적 시간격리와 반상식 환경, 반복성, 미래 과학적 영향력을 모두 합친 Operational Einstein Test를 실증하지 않았다.
측정할 수 있는 것과 아직 남은 것
ExplorationBench는 결정론적이고 정답이 실행으로 확인되는 두 세계를 이용한다. 실제 과학의 불완전하고 잡음이 섞인 관측, 비싼 또는 되돌릴 수 없는 실험, 열린 가설공간, 네 라운드보다 긴 연구기간은 반영하지 못한다. 논문도 현실의 과학 발견 자체를 측정하지 않는다고 명시한다.
아이디어 영향력 연구는 후속 채택을 평가함수에 들이는 실용적 단서를 제공하지만, 인용과 평가 모델 판단은 실제 과학적 진실 또는 획기적인 발견의 증명이 아니다. 이 연구 자체도 temporal isolation을 구현하지 않았다. 따라서 Einstein 수준의 검증에는 인용 수보다 독립 검증, 새로운 예측의 성공, 재현성과 연구분야 형성 같은 직접 결과가 더 적합하다.
강한 과학발견 평가는 정답을 찾아낸 최고 한 번의 결과만 기록하지 않는다. 어떤 실험을 스스로 선택했고, 낯선 증거로 규칙을 바꿨으며, 그 능력이 반복되는지와 후속 과학에 남는 결과를 함께 추적해야 한다.
두 논문은 사전공개본이다. 위 평가축은 두 원문의 결과 및 첨부 브리핑의 해석을 묶어 제안한 것으로, 공인 Einstein Test의 신규 공식 점수가 아니다.
원문과 프로토콜
- Zhang et al., ExplorationBench: Measuring AI Systems’ Exploration in Verifiable Alien WorldsarXiv:2609.30199 v1, 2026-09-24. 설계·결과·한계.
- ExplorationBench 프로젝트논문에 연결된 프로젝트 사이트.
- Kale, Garikaparthi & Patwardhan, Learning to Ideate for Scientific ImpactarXiv:2609.29802 v1; ICML 2026 RLxF Workshop.
- Singularity Gate 버전 이력v1.1 공개일과 시간격리 프로토콜 비교.