◆ EINSTEIN TEST / SCIENTIFIC AGENTS
RESEARCH WATCH · PUBLISHED 2026.09.30

과학을 발견하는 능력과
실험을 수행하는 능력

Einstein Test Research Watch: SciHorizon-eLab and Embodied Experimental Competence

SciHorizon-eLab의 프로토콜 컴파일과 SciVLABench를 과학적 발견 평가의 실행 계층으로 읽는다.가설·설계에서 프로토콜 실행에서 관측·반증으로 연결되고 새로운 증거를 환류하는 개념도. 실측 자료가 아닌 해석적 구조다.가설·설계01 / EVIDENCE프로토콜 실행02 / REASONING관측·반증03 / VALIDATIONNEW EVIDENCE / REVISION
핵심 연구축과 증거 환류를 연결한 개념도 · 제안과 실증의 구분은 각 절을 따른다.
RESEARCH QUESTION

SciHorizon-eLab의 프로토콜 컴파일과 SciVLABench를 과학적 발견 평가의 실행 계층으로 읽는다.

조사 기록과 근거 수준

게시일: 2026-09-30 · 첨부 조사 기준: 2026-09-29. 원문에 명시된 개별 발표일과 검색 기간은 본문에 보존했다. 논문 결과, 기업 자체 발표, 아직 실행되지 않은 후속 연구 제안을 구분한다. 검색 범위에서 신규 결과가 확인되지 않았다는 판단은 관련 연구 전체의 부재를 의미하지 않는다.

PART 01

연구 범위와 핵심 질문

이번 점검에서는 이전 실행 이후 새로 노출된 자료 가운데 1건만 의미 있는 업데이트로 선별했다. 직접적인 Einstein Test, SCILAWS-BENCH, TruthInsightBench, Singularity Gate에서는 별도로 보고할 정도의 중대한 공식 버전 변경은 확인되지 않았으며, 단순 리더보드 변동과 주변적 연구는 제외했다.

PART 02

SciHorizon-eLab · 실험 실행을 인증한다

저자/기관: Maokai Qin, Chuan Qin, Qi Zhang, Dianyu Liu, Zirui Liu, Hongting Niu, Yuanchun Zhou, Hengshu Zhu — Data Intelligence for Scientific Innovation Lab, Computer Network Information Center, Chinese Academy of Sciences (CAS) / Beihang University. 공개일: arXiv v1 2026년 9월 25일 제출, 9월 28일 recent 목록에 공개.

핵심 기여는 과학실험용 embodied agent를 평가하기 위한 SciVLABench와, 자연어 실험 protocol을 자동으로 benchmark task로 변환하는 SciHorizon-eLab compiler이다. 자연어 실험절차를 ① 의미가 보존된 simulation environment, ② 실제 robot-executable procedure, ③ 실행과 독립적으로 정의된 ordered success criteria로 변환한 뒤 simulation에서 물리적 실행 가능성과 평가조건을 인증한다. 이를 이용해 51개 protocol 기반 시나리오, 5개 실험 operation family, 30개 atomic skill로 300개의 인증된 laboratory task를 만들었고, 별도로 15개의 human-agent coordination task도 포함했다. 동일 과제의 randomized instance, unseen object/instrument binding에 대한 transfer, 단계별 procedural completion도 평가할 수 있다.

현재 능력 격차도 상당한다. 대표적인 10개 인증 과제에서 가장 강한 visuomotor policy조차 **평균 task success 49.7%**에 그쳤으며, human-agent coordination과 새로운 object binding으로의 일반화에서 추가적인 약점이 나타났다. 코드·benchmark data·evaluation toolkit도 공개됐다.

PART 03

발견 평가와 실행 평가를 결합한다

Einstein Test / AGI 평가와의 관련성은 “발견 그 자체”보다 “실험 실행 계층” 측면에서 중요한다. 지금까지 Operational Einstein Test 논의는 주로 가설 생성 → 반증 → 수정 → 미래 검증의 인지·인식론적 측면에 집중돼 있었는데, SciVLABench는 그 사이에 필요한 Embodied Experimental Competence를 독립적으로 측정할 수 있는 기반을 제공한다. 특히 “실험을 했다고 주장하는 것”과 “정확한 순서·상태·도구를 사용해 실제로 실험절차를 수행한 것”을 분리해 평가할 수 있다는 점이 중요한다.

따라서 강한 Einstein Test는 앞으로 다음처럼 가설 발견 능력과 실험 수행 능력을 분리한 뒤 다시 결합하는 구조가 더 적절해 보이다.

\[ \boxed{ \text{Abductive Hypothesis} \rightarrow \text{Discriminating Experiment Design} \rightarrow \mathbf{Embodied\ Protocol\ Execution} \rightarrow \text{Observation} \rightarrow \text{Falsification / Revision} } \]

다만 SciVLABench 자체가 Einstein Test는 아니다. 주어진 protocol을 정확하게 실행하는 능력을 평가하며, 새로운 연구문제를 스스로 발견하거나 경쟁 가설을 만들거나 시간격리된 조건에서 새로운 과학법칙을 발견하는 능력은 측정하지 않는다. 따라서 향후에는 SCILAWS-PARALLEL·ExplorationBench류의 hidden-law discovery + TruthInsightBench류의 epistemic evaluation + SciVLABench류의 embodied experimental execution을 결합하는 것이 Operational Einstein Test를 실제 자율과학자로 확장하는 유력한 방향이다.

출처: SciHorizon-eLab / SciVLABench arXiv · 공개 코드·벤치마크·평가도구

SOURCE RECORD

자료와 출처

구성 자료: Einstein Test-Trends-0929.md. 첨부의 모든 연구 항목, 비교, 수치, 표, 수식, 한계와 후속 연구 제안을 수록했다. 대화 시스템의 인용 표시와 알림 문구는 편집 과정에서 제거했다. 본문 링크는 해당 자료로 연결된다.

  1. SciHorizon-eLab / SciVLABench arXivarxiv.org · PRIMARY SOURCE / RESEARCH RESOURCE
  2. 공개 코드·벤치마크·평가도구github.com · PRIMARY SOURCE / RESEARCH RESOURCE