무엇을 발견할 것인가,
그 발견을 믿을 수 있는가
The Einstein Test: Scientific Foresight and Common-Mode Failure
과학지능에는 중요한 문제를 선택하는 능력과 발견의 타당성을 검증하는 능력이 함께 필요하다. BackTrend와 자율 재료 발견 연구는 이 두 평가축의 공백을 드러낸다.
과거 근거만 제공했다고 모델의 미래 지식까지 제거되는 것은 아니다. 여러 세션에서 같은 발견이 재현돼도, 공유된 데이터 결함이 같은 결론을 만들 수 있다. 평가 설계는 시간적 격리와 근거의 독립성을 별도로 점검해야 한다.
두 가지 업데이트, 두 개의 평가축
2026년 9월 23일 첨부 동향 브리핑은 이전 점검 이후 공개·확인된 자료를 검토했다. 그 결과, 중복·단순 리더보드 변동·경미한 수정은 제외하고 2건을 의미 있는 신규 업데이트로 판단했다고 첨부 브리핑은 기록한다. 특히 이번에는 temporally constrained scientific foresight benchmark와 autonomous discovery의 공통모드 오류(common-mode failure)가 중요하다. Einstein Test 자체, SCILAWS-BENCH, TruthInsightBench, Singularity Gate의 새로운 중대 공식 버전 변경은 첨부의 점검 범위에서 확인되지 않았다.
미래의 중요성을 과거의 신호에서 찾다
BackTrend: Evaluating Scientific Weak-Signal Prediction via Backward Reconstruction
저자/기관: Xiao Zhou, Yilun Zhao, Owen Jiang, Tiansheng Hu, Cai Xu, Manasi Patwardhan, Arman Cohan — Yale NLP Lab, New York University, TCS Research. 공개일: arXiv v1 2026년 9월 21일 UTC(한국시간 9월 22일 공개), EMNLP 2026 Findings로 arXiv에 표기되어 있다. (arXiv [1])
핵심 기여는 미래에 중요해질 연구방향의 약한 신호(weak signal)를 과거 시점의 정보만으로 찾아낼 수 있는지를 평가하는 BackTrend 벤치마크를 제안한 것이다. 25개의 성숙한 AI/ML 연구주제를 대상으로 2019–2023년 문헌에서 초기 precursor를 찾고, 2024년에 실제로 중요도가 상승했는지를 publication-frequency trajectory와 인용으로 역검증해 66개의 전문가 검증 weak signal을 구축했다. 문제공간 신호는 아직 주목받지 못한 새로운 연구문제, 해결공간 신호는 기존 문제에 대한 초기·비주류 해결방법으로 나눈다. 평가 시에는 2023년 말 이전 증거만 사용하도록 제한하며, frontier LLM·RAG·DeepResearch 계열을 평가한 결과 최고 시스템인 DeepSeek-R1-0528도 집합 수준 LLM-judge F1 10.1%, Coverage@10 18.5%에 불과했다. 주요 실패는 topic drift, granularity mismatch, near-miss, incomplete coverage였다. 데이터셋도 공개됐으며 논문에서 데이터셋 링크를 제공한다. (arXiv [2])
Einstein Test/AGI 평가와의 관련성은 높다. 첨부에서 설정한 Einstein Test의 문제해결 관점이 “과거의 주어진 과학문제를 해결할 수 있는가?”에 초점을 둔다면, BackTrend는 한 단계 앞선 “아직 주류가 아닌 문제나 방법 중 무엇이 미래에 중요해질지를 식별할 수 있는가?”를 측정한다. 즉 AGI 과학평가에서 Problem Solving뿐 아니라 Problem Selection / Research Foresight를 독립 축으로 만들 수 있다.
특히 평가 구조가
이라는 점에서 retrospective temporal backtesting의 좋은 사례이다. 다만 중요한 한계가 있다. 검색·RAG 증거는 2023년 이전으로 제한하지만 frontier LLM의 모델 가중치 자체가 2024년 이후 정보를 학습했을 가능성까지 제거한 것은 아니다. 따라서 이것은 강한 의미의 weight-level temporal isolation보다는 evidence-level temporal isolation으로 보는 것이 정확하다. Einstein Test에 적용하려면 모델 자체도 cutoff 이전 데이터로 학습하거나 behavioral leakage audit을 추가해야 한다. (arXiv [2])
출처: BackTrend arXiv 원문 · BackTrend 공개 데이터셋
평가를 읽는 경계: 25개 주제 중 검증 신호가 있는 18개 주제의 30개 주제–방향 쌍에서 위 성능을 평가했다. 입력에는 이미 성숙한 목표 주제가 주어진다. 따라서 이는 자유로운 미래 연구방향 예측 전체보다, 시간 제한 아래 특정 주제의 선행 신호를 복원하는 대리 과제이다. 66개 신호는 저자들 중 AI/ML 연구자들이 검증했으며 완전한 독립 외부 검증과는 구분한다. (arXiv [2])
같은 발견을 반복해도 같은 오류일 수 있다
Divergent strategies and convergent outcomes in autonomous materials discovery
저자/기관: Jihan Kim — KAIST 생명화학공학과, Molecular Simulation Group. 공개일: arXiv v1 2026년 9월 21일 UTC. Jihan Kim의 공식 KAIST 프로필도 현재 KAIST 생명화학공학과 교수 및 computational chemistry·materials design·AI 연구자로 확인된다. (arXiv [3])
이 연구는 동일한 scientific agent 구성의 단일 성공 사례를 넘어 동일 모델·하네스 구성에서 세션을 각각 초기화한 16개의 open-ended autonomous materials-discovery campaign을 반복했다는 점이 새롭다. 각 agent에는 12,499개의 metal-organic framework(MOF)로 구성된 동결 데이터베이스, methane-storage 목표, 동일한 protocol, 1주 연구예산을 제공했다. 에이전트들은 100–5,000개 구조를 탐색하는 서로 다른 4가지 연구전략으로 갈라졌고, 절반은 총 2,253개의 새로운 가상 구조까지 생성했다. 그럼에도 여러 run이 약 200 cm³/cm³ 부근의 동일한 materials frontier에 수렴했으며, 데이터베이스의 porous region을 별도로 계산했을 때 상위 9개 구조가 모두 agent 보고서에 포함됐다. (arXiv [3])
그러나 더 중요한 결과는 실패이다. 엄격한 재현성 검사를 넣자 검사 미적용 8개 세션과 검사 적용 8개 세션의 fresh-run reproduction은 각각 1/8 → 8/8로 차이를 보였지만, 과학적 결론의 타당성 개선은 검출되지 않았다. 16회 중 15회가 동일한 잘못된 구조를 선택했는데, 이 구조는 음이온이 누락된 불완전 데이터 때문에 인공적으로 큰 pore volume을 보였다. 즉 서로 다른 agent가 독립적으로 같은 결론에 도달했다고 해서 그 결론이 옳다는 보장은 없으며, 공유 입력 데이터의 오류가 모든 agent에 동일하게 전파되는 common-mode failure가 발생했다. (arXiv [3])
Einstein Test/AGI 평가에는 매우 중요한 경고이다. 지금까지 multi-agent Einstein Test 설계에서는 “여러 독립 agent가 같은 발견을 재현하면 신뢰도가 높다”는 가정을 하기 쉽다. 이번 연구는 그것이 충분하지 않음을 실증적으로 보여준다.
따라서 강한 Operational Einstein Test에서는 단순히 동일 문제를 여러 agent에게 반복시키는 것 외에 ① 원자료 무결성 검사, ② 독립적 데이터·측정 소스, ③ adversarial data audit, ④ orthogonal verification method, ⑤ shared-failure correlation 측정을 별도의 평가축으로 두어야 한다. 이는 특히 autonomous scientific discovery에서 reproducibility와 truth가 동일하지 않다는 중요한 구분이다.
출처: arXiv 원문 · Jihan Kim / KAIST 연구실
독립성의 범위: 세션 초기화의 독립성은 데이터·모델·하네스·검증 방법의 독립성을 뜻하지 않는다. 이 연구는 서로 다른 모델 집단이나 실험실의 독립적인 물리 측정이 아니라, 공유 조건 아래 실행을 반복한 연구이다. 15/16은 해당 캠페인의 관측치이며 모든 과학 에이전트의 일반 오류율이 아니다. (arXiv [3])
강한 Operational Einstein Test의 조건
이번 업데이트를 Einstein Test 설계 관점에서 한 문장으로 요약하면, BackTrend는 “미래에 중요해질 문제를 과거 정보만으로 식별하는 능력”을 새로운 평가축으로 추가하고, KAIST 연구는 “여러 AI가 같은 발견을 재현했다”는 사실만으로는 진실성을 보장할 수 없음을 보여준다. 따라서 현재까지의 추적결과를 반영한 강한 평가구조는
로 확장하는 것이 타당하다.
설계 제안의 지위: 위 구조는 두 논문을 Einstein Test에 연결한 첨부 브리핑의 종합 제안이다. Einstein Test의 공식 개정안이나 AGI를 판정하는 검증된 충분조건으로 읽어서는 안 된다. 시간적 격리와 공통모드 오류 감사는 각각 지식 누출과 공유 근거의 결함을 점검하는 서로 다른 통제축이다.
참고자료
- [2609.24921] BackTrend: Evaluating Scientific Weak-Signal Prediction via Backward Reconstruction2026 · 논문 원문
- BackTrend: Evaluating Scientific Weak-Signal Prediction via Backward Reconstruction2026 · 논문 원문
- [2609.23957] Divergent strategies and convergent outcomes in autonomous materials discovery2026 · 논문 원문
- BackTrend 공개 데이터셋논문에서 제공한 링크 · 데이터셋 페이지 직접 열람은 확인하지 못함
- Jihan Kim · KAIST Molecular Simulation Group공식 소속 확인
편집 원자료: Einstein Test-Trends-0923.md. 두 신규 연구의 저자·소속·공개일·실험 조건·수치·한계·출처와 세 개의 개념식을 반영했다. 공식 버전 변경의 부재는 첨부의 점검 범위에 한정한다. 성능 평가의 단위와 반복 실험의 독립성 범위를 원문에 따라 보완했다.