◆ EINSTEIN TEST / SCIENTIFIC REASONING
RESEARCH WATCH · SOURCE DATE 2026-09-30

찾아보는 능력과
새롭게 발견하는 능력

Einstein Test Research Watch: EvoDuet, OmniVCBench, and Evidence-Grounded Discovery

EvoDuet의 검색 제어와 OmniVCBench의 증거 기반 추론을 지식 격리, 기전 설명, 독립적 발견의 평가와 연결한다.지식 획득 · 설명·가설 · 독립 검증의 관계를 연결한 해석적 개념도. 실측 자료가 아닌 해석적 구조다.지식 획득01 / EVIDENCE설명·가설02 / REASONING독립 검증03 / VALIDATIONNEW EVIDENCE / REVISION
핵심 연구축과 증거 환류를 연결한 개념도 · 제안과 실증의 구분은 각 절을 따른다.
RESEARCH QUESTION

EvoDuet의 검색 제어와 OmniVCBench의 증거 기반 추론을 지식 격리, 기전 설명, 독립적 발견의 평가와 연결한다.

조사 기록과 근거 수준

게시 기준일: 2026-09-30. 별도 갱신일이 없어 본문에 수록된 최신 연구 공개일을 게시 기준일로 사용한다. 원문에 명시된 개별 발표일과 검색 기간은 본문에 보존했다. 논문 결과와 기관 발표, 문헌 간 종합 해석, 아직 수행되지 않은 통합 연구 제안을 구분한다. 각 수치는 첨부에서 보고한 실험 조건과 함께 읽어야 한다.

PART 01

평가 범위와 프로토콜 상태

이전 실행 이후 새로 확인된 자료를 재점검한 결과, 중복·단순 리더보드 변동·경미한 버전 수정은 제외하고 2건을 의미 있는 신규 업데이트로 선별했다. Einstein Test 자체와 Singularity Gate에는 새로 보고할 중대한 프로토콜 변경이 없으며, Singularity Gate는 현재도 v1.1 contamination-cleaned 설정을 유지하고 있다. Singularity Gate

PART 02

EvoDuet · 검색과 후보해의 공동 진화

EvoDuet: Bilevel Co-Evolution of Web Searching and Task Solving for Scientific Discovery — Young-Jun Lee, Jinheon Baek, Soyeong Jeong, Minki Kang, Seungyeon Jwa, Jonghyun Choi, Seungho Han, Dongyeop Kang; University of Minnesota · KAIST · Seoul National University · Hanyang University. 공개일: 2026년 9월 30일(arXiv v1). 핵심 기여는 scientific discovery를 단순히 “현재 지식으로 해답을 탐색하는 과정”으로 보지 않고, 해답(solution)과 필요한 외부지식을 찾기 위한 검색질의(search query)를 함께 진화시키는 bi-level co-evolution으로 만든 것이다. Retrieval gate가 매 단계에서 새 검색, 기존 문서 재사용, 검색 생략을 선택하고, 내부 루프가 검색어와 문서 순위를 개선하며 외부 루프가 실제 후보해를 평가한다. 21개 최적화 과제에서 OpenEvolve 대비 Normalized Discovery Gain이 GPT-5.6-Luna에서 74.1%→78.0%, Gemini-3.8-Flash에서 **61.3%→82.3%**로 향상됐고, 선택된 실행에서는 기존 보고 최고기록 8개를 갱신하고 3개를 동률로 맞췄다. 모델에 따라 효과가 보편적이지 않아 Qwen3.5-9B에서는 오히려 성능이 낮아졌다는 점도 중요한다. arXiv

Einstein Test/AGI 평가와의 관련성: 상당히 중요하지만 강한 Einstein Test의 통과 증거는 아니다. 이 연구는 과학적 발견에서 무엇을 모르는지 감지 → 필요한 근거를 스스로 검색 → 새 지식에 따라 탐색방향 수정이라는 epistemic search control을 명시적으로 구현한다. 반면 open-web retrieval을 허용하기 때문에, 결과가 새로운 원리의 독립적 발견인지 아니면 외부 문헌에 존재하는 방법의 재조합인지 분리하기 어렵다. 실제 프로젝트 분석에서도 82개 실행 중 55개에서 기존 방법 전이가 관찰됐고, 일부는 공개 artifact를 직접 재사용했다. 따라서 Operational Einstein Test에서는 앞으로 Closed-Knowledge Discovery Track과 Open-Retrieval Research Track을 별도로 평가해야 한다는 근거가 됩니다. Open Galapagos
출처: arXiv 원문 · EvoDuet 프로젝트 페이지

PART 03

OmniVCBench · 예측·설명·가설의 분리

OmniVCBench: Benchmarking Evidence-Grounded Multimodal Reasoning Towards AI Virtual Cells — Manyu Li, Xunkai Li, Yongfu Xiong, Yi Liu, Rong-Hua Li, Guoren Wang; Fudan University · Beijing Institute of Technology · Chongqing Ant Consumer Finance. 공개일: 2026년 9월 29일(arXiv v1). AI Virtual Cell을 단순한 perturbation-response predictor가 아니라 실험결과를 읽고, 메커니즘을 설명하고, 다음 검증가설을 제안하는 scientific agent로 평가하기 위한 benchmark이다. 1,080편의 논문에서 추적 가능한 실험 figure를 기반으로 6,077개 QA를 만들고, 평가를 L1 Evidence-conditioned inference → L2 Mechanistic explanation → L3 Evidence-grounded hypothesis proposal의 세 단계로 나눴다. Open-response용 AIVC-Judge는 주장 단위로 source evidence를 추적하고, 실제 모델 오류를 hard negative로 바꿔 MCQ도 구성한다. 현재 평가된 최고 proprietary model조차 평균 3.28/5.00에 그쳤으며, 저자들은 state prediction만 잘한다고 실험결과 해석·기전 설명·다음 가설 생성 능력이 보장되지 않는다고 지적한다. arXiv

Einstein Test/AGI 평가와의 관련성: 이번 업데이트에서 특히 유용한 점은 “예측(prediction) → 설명(explanation) → 발견가설(discovery proposal)”을 서로 다른 능력으로 분리했다는 것이다. 이는 최근 MechBench에서 나타난 법칙 적합 ≠ 메커니즘 이해와 직접 연결된다. 다만 중요한 제한도 있다. 저자들은 L3가 진정한 open-ended novelty나 새로운 discovery 자체를 평가하지 않으며, 기존 source evidence에 근거한 bounded hypothesis proposal이라고 명시한다. 즉 OmniVCBench는 Einstein Test의 mechanistic abduction과 evidence-grounded hypothesis formation 구성요소에는 매우 유용하지만, temporal isolation, 독립적 novelty, 미래 예측 성공, 실제 실험적 반증까지 측정하지는 않는다. arXiv
출처: OmniVCBench arXiv 원문 · 공개 코드·데이터 데모

PART 04

지식 격리와 독립적 발견의 평가

이번 업데이트가 Einstein Test 설계에 주는 핵심은 “과학지식 획득 방식”과 “과학적 추론의 깊이”를 각각 분리해 평가해야 한다는 점이다. 현재까지의 추적을 종합하면 평가구조는 다음처럼 더 정교해집니다.

\[ \boxed{ \text{Temporal / Knowledge Isolation} \rightarrow \text{Knowledge-Gap Detection} \rightarrow \text{Evidence Acquisition} \rightarrow \text{Phenomenal Prediction} \rightarrow \text{Mechanistic Explanation} \rightarrow \text{Abductive Hypothesis} \rightarrow \text{Discriminating Experiment} \rightarrow \text{Counter-Evidence Revision} \rightarrow \text{Independent Future Validation} } \]

특히 EvoDuet는 “무엇을 찾아봐야 하는지 스스로 판단하는 능력”, **OmniVCBench는 “찾은 증거에서 무엇을 추론·설명·가설화할 수 있는지”**를 각각 보완한다. 그러나 두 연구 모두 아직 정보를 차단한 상태에서 새로운 과학원리를 독립적으로 발명하는 강한 Einstein Test와는 명확히 구분해야 한다.

SOURCE RECORD

자료와 출처

구성 자료: Einstein Test-Trends-1003.md. 첨부의 모든 연구 항목, 비교, 수치, 표, 수식, 한계와 후속 연구 제안을 수록했다. 대화 시스템의 인용 표시와 알림 문구는 편집 과정에서 제거했다. 본문 링크는 해당 자료로 연결된다.

  1. Singularity Gatesingularitygate.org · PRIMARY SOURCE / RESEARCH RESOURCE
  2. arXivarxiv.org · PRIMARY SOURCE / RESEARCH RESOURCE
  3. Open Galapagosopen-galapagos.github.io · PRIMARY SOURCE / RESEARCH RESOURCE
  4. arXivarxiv.org · PRIMARY SOURCE / RESEARCH RESOURCE
  5. OmniVCBench arXiv 원문arxiv.org · PRIMARY SOURCE / RESEARCH RESOURCE
  6. 공개 코드·데이터 데모anonymous.4open.science · PRIMARY SOURCE / RESEARCH RESOURCE