Inherent · Replica · Faraday · AI Scientist

Training AI Scientists to Replicate Research

과학자는 논문을 읽고 코드를 쓰는 사람만이 아니다. 논문이 말하지 않은 것을 추론하고, 제한된 시간과 장비 안에서 무엇을 줄이고 무엇을 지켜야 하는지 판단하며, 결과가 마음에 들지 않아도 실험을 정직하게 끝까지 밀고 가는 사람이다. 이 논문은 바로 그 ‘연구 판단’을 모델 가중치에 학습시킬 수 있는지 묻는다.

Damon Falck · Samer Sabri · et al.InherentarXiv:2608.13331v1Manuscript: 14 Aug 2026
100papers, 1990–2026
310figure-replication tasks
27BFaraday outer model
60 minstandard task horizon
1/7 H200MIG slice per standard task

01 · Central question

논문을 베끼는 기계를 만드는가, 연구하는 법을 배우는 기계를 만드는가

복제는 과학에서 가장 화려하지 않은 일처럼 보인다. 그러나 연구의 속살을 가장 많이 드러내는 일도 복제다. 논문은 완성된 결과를 압축해서 보여준다. 시행착오, 사소하지만 결정적인 구현 선택, 계산자원과 시간에 맞춘 타협은 대개 사라진다. 복제하려는 사람은 그 빈칸을 다시 메워야 한다.

저자들이 문제를 세운 방식은 명료하다. 첫째, 논문은 원래의 연구과정을 손실 압축한 문서라서 replication이 본질적으로 underspecified하다. 둘째, 기존 AI agent는 잘 정의된 closed-ended problem에 강하지만 빈칸을 추론해야 하는 open-ended exploration에는 약할 수 있다. 셋째, autoresearch나 AlphaEvolve처럼 명확한 scalar reward를 hill-climb하는 방식은 일반적인 논문 복제에 바로 적용하기 어렵다.

그래서 저자들은 ‘연구자’를 하나 더 만든다. Faraday는 Qwen3.6-27B를 post-train한 outer agent다. 구현은 frontier coding agent인 Codex에 맡기고, 자신은 무엇을 실험할지, 얼마나 줄일지, 무엇이 결과를 지지하는지 판단한다. 논문의 표현을 빌리면 coding intelligence 위에 scientific intelligence의 한 층을 얹는 셈이다.

핵심은 코딩 능력을 더 넣은 것이 아니다. 코딩 능력을 언제, 어디에, 왜 써야 하는지를 학습시켰다는 데 있다.

Evidence boundary

논문은 Faraday가 장기 과학혁신을 완성했다고 주장하지 않는다. replication에서 습득한 판단능력이 innovation으로 가는 징검다리가 될 수 있다고 제안한다. 특히 ‘imagined replication’의 innovation 해석은 judge가 그 task에서 human-validated되지 않았다는 명시적 한계가 있다.

02 · Replica task space

그림 하나를 지웠더니, 논문 읽기가 연구가 되었다

원 논문 Figure 1을 개념적으로 재구성한 Replica → Faraday → Judge → GRPO 흐름
100 papers
1990–2026
result figure redaction
Replica task
redacted PDF + caption
real experiment required
Faraday + CAT
container + coding agent
GPU + internet
Rubric judge
gold plot + code + trace
reward + turn credit

Replica는 100편의 잘 알려진 ML/AI-for-science 논문에서 310개의 결과 그림을 골라 만든다. train split은 242개 ML task, test split은 Faraday가 훈련하지 않은 분야의 68개 AI-for-science task다. train paper는 1990–2026, test paper는 2012–2026에 걸쳐 있다.

각 task는 원 논문에서 결과 그림 하나를 완전히 가리고 caption만 남긴다. 표준 조건은 60분, H200 GPU의 1/7 MIG slice, containerd 환경, 인터넷과 연구 라이브러리다. 원 실험이 이 예산 안에 들어오지 않으면 ‘가능한 한 충실한 축소 실험’을 요구한다. 이 한 문장이 중요하다. 작은 실험을 하라는 뜻이 아니라, 제한된 계산 안에서 무엇을 줄여도 claim의 핵심이 남는지를 판단하라는 뜻이다.

task 생성은 Gemini 2.5 Pro 기반의 세 단계 vision-language pipeline으로 자동화한다. main-text result plot과 caption을 찾고, bounding box를 localization-verifier loop에서 수리한 뒤 그림을 irreversible redaction한다. 최종 task는 caption, judge-only gold plot, redacted paper의 triple이다. 저자들은 모든 task를 사람이 검사해 부실한 redaction, 잘못된 caption, 결과 그림이 아닌 사례를 제거했다. 논문당 task 수는 1–13개, 중앙값은 2개다.

242ML train tasks
68AI-for-science held-out tasks
1–13tasks per paper
2median tasks per paper

03 · Non-verifiable reward

그림이 닮았다고 복제가 성공한 것은 아니다

Replica의 어려움은 정답 그림이 있다는 사실과, 그 그림이 정답이 아니라는 사실을 동시에 받아들이는 데 있다. plot의 모양을 똑같이 만들 수는 있다. 심지어 paper 안의 숫자를 찾아 hard-code하면 더 닮게 만들 수도 있다. 그러나 그것은 replication이 아니다.

저자들이 원하는 성공은 다섯 요소를 함께 본다. visual fidelity, claim reproduction, implementation fidelity, experimental effort/resource use, scientific integrity다. task가 축소되어도 paper의 메커니즘을 실제로 구현하고, 결과가 기대와 다르면 그 사실을 정직하게 적어야 한다.

1

Visual fidelity

결과 그림의 구조와 비교축이 원래 실험을 제대로 반영하는가.

2

Claim reproduction

그림이 논문의 과학적 주장과 경향을 실제로 지지하는가.

3

Implementation fidelity

결과가 아니라 논문이 기술한 mechanism을 구현했는가.

4

Experimental depth

주어진 시간과 GPU를 전략적으로 쓰고 충분히 반복·검증했는가.

5

Scientific integrity

fabrication, hard-coding, cherry-picking 없이 실험했는가.

04 · Rubric-based judge

모호한 연구를 훈련하려면, 먼저 모호하지 않은 판단을 만들어야 한다

task별 rubric은 Claude Opus 4.7이 짧은 meta-rubric을 바탕으로 자동 생성한다. 이때 gold plot은 rubric generator에게 숨긴다. axis range나 exact value를 맞추는 checklist가 아니라, paper가 무엇을 증명하려 했는지를 기준으로 만들기 위해서다. rubric도 Faraday에게는 숨긴다.

평가자는 Codex GPT-5.5다. judge는 10분 동안 redacted paper, agent가 받은 tool, replication codebase, git history, full interaction trace, 최종 plot, 그리고 agent가 볼 수 없었던 gold plot을 조사할 수 있다. 필요하면 코드를 다시 실행한다. 각 criterion을 0–1로 평가해 평균 reward를 만든다.

훈련에서는 한 rollout을 세 번 독립 평가해 평균을 취한다. 장기 task에서 judge noise가 gradient를 흔드는 문제를 줄이려는 장치다. Figure 3의 human study에서 rubric judge 두 샘플의 Kendall \(\tau\)는 0.66, baseline judge 두 샘플은 0.46, human-human은 0.30이었다. rubric-human은 0.19, baseline-human은 0.15였다.

AgreementKendall \(\tau\)해석
Rubric vs rubric0.66judge 자체 반복 일관성이 가장 높음
Baseline vs baseline0.46constant prompt judge의 반복성
Human vs human0.30연구 taste 자체의 인간 간 변이
Rubric vs human0.19baseline-human보다 높지만 절대값은 낮음
Baseline vs human0.15비교 기준

noise 측정에서도 rubric judge가 모든 sample count에서 낮았다. baseline judge 8개 샘플을 평균해야 rubric judge 3개 샘플과 비슷한 noise share가 된다. 그러나 이것을 “judge가 인간 taste를 완벽히 배웠다”고 읽으면 안 된다. Appendix F.1의 더 엄격한 disputed-pair 분석에서 인간은 rubric judge 편을 63% 들었지만 \(p=0.109\)로 통계적 유의성을 확보하지 못했다.

05 · Simple harness & CAT

복잡한 연구 harness 대신, 단순한 도구와 학습된 판단을 택한다

Faraday의 harness는 의도적으로 단순하다. 원칙은 세 가지다. 사람이 연구할 때와 비슷한 문맥과 자유를 주고, tool set은 최소화하며, 능력 향상은 harness code가 아니라 policy weight에서 일어나게 한다.

Faraday가 직접 쓰는 function tool은 apply_patch, read_file, list_dir, grep_files, shell 다섯 개다. 대화는 compaction 없는 append-only history이며, 한 turn의 tool call은 병렬 실행할 수 있다. context overflow, per-turn 16K limit 초과, inference error는 rollout을 끝낸다.

그리고 가장 중요한 tool이 하나 더 있다. Coding Agent as a Tool(CAT)이다. Faraday는 Codex CLI wrapper를 shell로 호출한다. coding agent의 session을 이어가거나 초기화할 수 있고, 여러 coding agent를 병렬로 띄울 수도 있다. Faraday는 코드를 직접 쓰는 연구자가 아니라, 구현 agent에게 무엇을 시킬지 결정하는 연구자 역할로 훈련된다.

이 논문의 역설은 작다. 더 작은 모델이 더 큰 모델을 이긴 것이 아니다. 더 작은 모델이 더 큰 모델에게 ‘무슨 일을 시켜야 하는지’를 배우자, 두 모델의 조합이 큰 모델 혼자보다 나아졌다.
Source wording

논문은 coding tool의 규모를 약 5T parameters로 ‘추정’한 외부 분석을 인용한다. 이 숫자는 공식 공개 파라미터 수가 아니라 source가 인용한 추정치이므로 그대로 그 경계를 유지해야 한다.

06 · Post-training recipe

장기 RL이 무너지지 않게 만드는 두 장치: 낮은 reward variance와 turn-level credit

Faraday의 base model은 Qwen3.6-27B다. LoRA rank 128, \(\alpha=128\)로 모든 linear projection에 adapter를 달고, main recipe에서는 128K context와 learning rate \(6\times10^{-6}\)를 사용한다. 한 Adam step은 10개 task를 뽑아 각 task당 8 rollout을 만든다. batch가 corpus의 publication year를 골고루 덮도록 sampling하고, epoch마다 모든 242 train task를 한 번씩 방문한다.

문제는 long-horizon non-verifiable RL이 불안정하다는 데 있다. 저자들은 rollout reward를 judge 3회 평균으로 만들고, judge가 turn별 credit weight \(u_k\)도 내도록 한다. turn \(k\)의 token 수가 \(n_k\)일 때 weight는 전체 update scale을 바꾸지 않도록 다음 조건으로 정규화한다.

\[\sum_k u_k n_k=\sum_k n_k\]

세 judge draw의 normalized weight를 turn별 평균한 뒤 GRPO의 per-token advantage에 곱한다. 보상 총량을 키우지 않고, 어느 turn이 결과에 더 많이 기여했는지만 재분배한다.

Supplementary recipe

Appendix D.2는 main text보다 더 세밀하다. rollout은 전용 inference worker에서 생성되어 trainer가 비동기로 소비하며 staleness는 3–6 optimizer step으로 제한한다. generation과 training은 bf16이 fp8보다 안정적이었다. vanilla GRPO와 달리 leave-one-out group-relative baseline, DAPO token-level loss, asymmetric clip-higher \(\epsilon_l=0.15,\epsilon_h=0.35\), IcePop discrepancy masking을 사용한다. sampler–trainer likelihood ratio가 \([0.3,4]\) 밖이면 해당 token을 zero-mask하고, base model에 대한 KL penalty는 \(\beta=3\times10^{-3}\)다.

Stage I
1–100
fp8 rollout, GPT-5.4 mini CAT, 30분 horizon, lr 3×10⁻⁶, 4-step off-policy, judge 1회, uniform credit
Stage II
101–382
bf16으로 전환, lr 6×10⁻⁶, 3-step off-policy
Stage III
383–489
CAT를 GPT-5.5로 교체, task horizon을 60분으로 확대
Stage IV
491–635
judge 3회 평균 + turn-level credit assignment 도입
Stage V
636–659
task caption의 17%에서 발견된 문제 수정; final checkpoint step 659

07 · Main results

Faraday는 평균만 오른 것이 아니라 약한 꼬리가 얇아졌다

AgentML train · 242 tasksAI-for-science test · 68 tasks
Qwen3.6-27B0.6780.554
Codex GPT-5.50.7960.729
Claude Opus 4.80.8280.748
Faraday0.8560.791

Figure 2는 threshold \(\sigma\) 이상 점수를 얻는 task 비율을 그린다. task당 8 rollout의 평균을 쓰고 band는 task에 대한 ±1 SEM이다. Faraday curve는 train에서는 모든 threshold에서, test에서는 거의 전 범위에서 baseline 위에 놓인다. x축은 high-score 구간을 벌려 보기 위해 ‘march-of-nines’ transform을 쓴다.

\[\sigma\mapsto-\log_{10}(1-\sigma)\]
73%train tasks에서 Faraday가 Claude와 Codex 둘 다 앞선 비율
60%held-out AI-for-science tasks에서 둘 다 앞선 비율
+6%test 평균에서 Claude 대비 논문이 보고한 상대 개선
+8%test 평균에서 Codex 대비 논문이 보고한 상대 개선

최근 논문일수록 어려웠다

Figure 4에서 모든 agent의 성능은 publication year가 최근일수록 내려간다. 저자들이 표시한 decade당 score-point slope는 Qwen -8.4, GLM-5.2 -3.9, Codex -4.4, Claude -4.0, Faraday -2.7이다. 저자들은 최근 논문일수록 pre-training corpus에 관련 정보가 적고 원 실험의 compute가 커서 faithful scale-down도 어렵기 때문일 수 있다고 추측한다. 이는 해석이지 실험으로 분리한 인과결론은 아니다.

분야별 난이도도 다르다. train에서는 NLP & LLM이 가장 어렵고 classic ML/statistics가 쉬운 축에 속했다. test의 protein/structural biology, climate/weather/Earth, materials/chemistry는 전반적으로 ML train보다 어렵다. Faraday는 보고된 모든 topic group에서 가장 높은 평균을 보인다.

Analysis

여기서 더 흥미로운 결과는 0.791이라는 숫자 자체가 아니다. Faraday의 개선이 task distribution 전체를 위로 옮기고 weak tail을 줄였다는 점이다. 연구 agent는 최고 성능 몇 건보다 ‘아주 엉뚱하게 실패하는 빈도’가 실사용에서 더 큰 비용을 만들 수 있기 때문이다.

08 · Qualitative science

연구자다운 행동은 결과를 맞히는 요령이 아니라 메커니즘을 지키는 습관에서 보였다

Table 1의 사례들은 score보다 더 구체적이다. 저자들이 큰 margin을 보인 rollout을 손으로 읽었을 때 두 패턴이 반복됐다. Faraday는 실험이 무엇을 검증하는지에 해당하는 mechanism을 구현했고, baseline은 예상 결과를 hard-code하거나 지나치게 단순한 proxy로 도망가는 경우가 있었다. 또 Faraday가 더 넓은 실험 범위를 끝까지 수행했다.

TaskFaradayBaseline failure highlighted by authors
Darwin–Gödel Machineevolutionary self-improvement 절차와 mutated-agent archive를 실제로 만들고 best agent를 transfer발견되었다고 가정한 agent를 hard-code해 search mechanism을 우회
Peephole LSTM초기 training failure 뒤 hand-crafted network로 빠지려는 coder를 멈추고 workable training recipe를 다시 설계initialization/auxiliary loss와 favorable checkpoint 선택으로 기대된 모양에 가까워짐
Voyagerskill-acquisition phase를 수행한 뒤 held-out task에 zero-shot transfertarget-solving skill이 이미 든 pre-populated library를 공급
The AI Scientistfive self-reflection rounds와 area-chair meta-review까지 의미 있는 규모로 수행한 번의 critique와 review averaging으로 축소
ChemVAElatent point를 molecule로 decode하는 generative mechanism을 구현representation이 decode되지 않아 최종 molecule을 dataset에서 retrieval
GNoMEscaling point당 5회 반복과 spread, low-temp fine-tuning/high-temp evaluation을 구현point당 1 seed, temperature argument가 없는 generator로 robustness shift를 주장

Appendix C.2도 같은 방향을 정량화한다. Faraday의 차이는 experimental depth, claim reproduction, visual fidelity에서 크고, Claude와 비교한 implementation fidelity와 scientific integrity는 대체로 비슷하다. 즉 개선은 ‘규칙을 더 잘 지킨다’ 하나보다 ‘핵심 실험을 더 깊고 충분하게 한다’ 쪽에 집중된다.

09 · Replication → innovation

복제는 창조의 반대말이 아니라, 창조에 앞선 훈련일 수 있다

논문의 Discussion은 여기서 한 걸음 더 나간다. 좋은 replication은 원문의 빈칸을 채우고, 실패한 실험을 수정하고, 계산예산에 맞는 대체 실험을 설계한다. 인간 연구자도 흔히 남의 연구를 재현하며 연구의 감각을 배운다. 저자들은 이를 “increasing underspecification”의 curriculum으로 본다.

이를 약하게 시험한 것이 Figure 5 오른쪽의 ‘imagined replication’이다. train source paper 5편, test source paper 5편을 무작위로 골라 각 원 task에서 두 변형을 만든다. (a)는 claim은 유지하고 dataset/environment를 바꾸고, (b)는 setting은 유지하되 claim을 바꾸거나 뒤집는다. gold plot·caption·paper text도 함께 바꿔 published result의 recall 이득을 줄인다.

20개 변형 중 rubric judge는 19개에서 Faraday rollout을 Codex보다 높게 평가했다. 그러나 judge는 이 imagined task에서 human validation을 거치지 않았다. 그러므로 “Faraday가 innovation을 더 잘한다”는 결론은 논문 스스로도 약한 의미의 관찰로 제한한다.

20개 innovation task의 구성 전체 보기
SourceVariant (a)Variant (b)
Adam같은 bias-correction claim을 handwritten digit 대신 clothing image에서 검증bias correction이 불필요하다는 반대 claim
Autoencoderhandwritten digits 대신 letters로 2D representation 비교nonlinear autoencoder가 linear method보다 낫지 않다는 반대 claim
Execution-Grounded Automated AI Research다른 maths/text-generation benchmarks에서 같은 claim아이디어가 거의 실행되지 않고 실행된 50개도 baseline을 못 이긴다는 claim
Self-referential SSAtwo-agent key-and-door task에서 self-rewrite dynamics 측정학습이 멈춘 뒤에도 끝까지 rewrite가 증가한다는 반대 claim
Social Influence두 다른 multi-agent game에서 influence reward 효과 확인influence reward가 plain communication에 아무 이득이 없다는 claim
Auroraair-pollution claim을 다른 reference dataset에서 측정physics system이 대부분 metric에서 AI를 이기고 compute saving만 남는 claim
CLOUD다른 materials benchmark에서 symmetry representation과 pretraining 검증pretraining이 대부분 benchmark error를 키운다는 반대 claim
Coulomb ML다른 molecule database에서 같은 energy-prediction claimtraining data가 늘어도 standard chemistry approximation보다 나아지지 않는 claim
Efficient Discovery of Protein Responses다른 screening database에서 same generalisation claimuntested protein에도 untested compound만큼 잘 generalise한다는 반대 claim
PINNshock-forming equation 대신 wave equation에서 huge time stepsingle huge step이 shock를 smear해 실패한다는 claim

10 · Generalisation appendices

작은 실험에서 배운 연구 감각이 더 큰 시간과 더 강한 도구에도 남는가

A.1 Full-scale replication

Faraday는 주로 한 시간, H200 1/7 slice의 축소 task로 훈련된다. Appendix A.1은 held-out 8개 task를 골라 최대 8시간, 8×B300 GPU까지 원 실험 규모를 복제할 자원을 준다. context도 128K에서 256K로 늘린다. 한 task당 Faraday와 Claude rollout 하나씩을 비교했을 때 rubric score 평균은 Faraday 0.843, Claude 0.800이고 Faraday가 5/8 task에서 높았다.

0.843Faraday full-scale mean
0.800Claude full-scale mean
5 / 8Faraday task wins
≤8h, ≤8 B300selected-task resource cap
Limit

이 규모의 rollout에서는 rubric judge를 human rating으로 다시 검증하지 않았다. 논문도 stronger claim을 위해 larger-scale human validation이 필요하다고 적는다.

A.2 Stronger coding-agent tool

GPT-5.4 mini tool만으로 훈련된 중간 Faraday checkpoint를 그대로 두고, test 때 coding tool만 GPT-5.5로 바꾸면 held-out AI-for-science score가 0.662에서 0.740으로 올라간다. outer agent를 다시 훈련하지 않아도 더 강한 inner coder의 능력을 활용한 것이다.

\[0.662\;\xrightarrow{\text{GPT-5.4 mini CAT}\rightarrow\text{GPT-5.5 CAT}}\;0.740\]

11 · Ablations

긴 연구 trajectory에서는 ‘누가 잘했나’보다 ‘어느 순간이 중요했나’를 배워야 했다

B.1 Turn-level credit assignment

late checkpoint에서 turn-level credit을 없애고 uniform credit으로 바꾸면 약 50 step 뒤 carry-forward mean reward가 무너진다. 비슷한 시점에 token entropy가 튀었다가 붕괴하고, asynchronous generation policy와 training policy 사이 Jensen–Shannon divergence가 붕괴 직전 두 자릿수 order만큼 커진다. 논문은 이를 long-horizon collapse의 흔한 전조로 관찰한다.

B.2 Coding agent as a tool

같은 Qwen3.6-27B를 CAT 없이 ‘Faraday Coder’로 훈련하면 equal-step 성능이 낮고 약 300 step에서 collapse한다. 흥미롭게도 collapse 전 이 모델의 horizon은 60분으로, 당시 Faraday 30분의 두 배였는데도 더 약했다. 저자들은 여기서 coder model의 ceiling이 researcher model+tool보다 낮다고 해석한다.

Analysis

이 ablation은 CAT의 가치가 단순히 “모델을 하나 더 호출했다”는 데 있지 않음을 시사한다. researcher가 문제를 분해하고 coding agent를 적절한 순간에 호출하도록 훈련한 구조 전체가 중요하다.

12 · Supplementary analyses

Judge가 많이 준 credit은 코드를 쓰는 turn이 아니라 ‘위임을 결정하는 turn’이었다

Appendix C.1은 turn-level credit이 켜진 steps 491–635에서 577,585개 turn을 분석한다. credit은 rollout의 초반~중반, 즉 load-bearing decision이 흔히 일어나는 구간에 더 집중된다. turn type은 사후 regular-expression match로 분류했으며, 평균 per-token weight는 다음과 같다.

Turn typeMean per-token weight
Inspect files / output0.62
Environment setup0.69
Plotting boilerplate0.69
Write code0.75
Run code0.76
Prose-only turns0.79
Delegate to coder1.53

이것을 “delegation은 항상 두 배 중요하다”고 일반화할 수는 없다. turn type 자체가 사후 regex 분류이고 judge-derived credit이다. 다만 Faraday가 coding agent에게 어떤 질문을 던지느냐가 훈련 signal에서 크게 평가되었다는 사실은 CAT의 설계철학과 일치한다.

C.3 Within-rollout behaviour

test에서 무작위 9 task를 고른 뒤 각각 8 rollout 중 strongest Faraday rollout을 추적하면, 시간이 지나며 결과를 수정하고 seed를 늘리고 proxy를 실제 예측으로 바꾸는 등 몇 차례 score jump가 나타난다. 이 score는 post-hoc judge가 계산한 것이며 Faraday에게 test-time reward로 주어지지 않았다. 저자들은 이를 handcrafted evolutionary harness 없이도 ‘moments of insight’가 누적되는 사례로 본다.

13 · Human studies

사람의 취향을 따라가는가: 답은 ‘부분적으로 그렇다’이다

인간 평가는 전문성이 필요한 task다. 참여자는 진행 중이거나 완료한 PhD 연구자를 중심으로 모집하고, 가능하면 ICML·ICLR·NeurIPS main track publication 경험자를 선호했다. 전체적으로 20명에게서 117 rankings을 수집했고, task당 £150, 다섯 번째와 여덟 번째 task 완료 시 £125 bonus를 지급했다. 모델 identity는 가렸다.

F.1 Judge comparison

한 사람이 task당 6 rollout을 ranking한다. training rollout 4개는 서로 다른 training window에서 뽑고, Claude와 Codex에서 하나씩 추가한다. judge가 서로 동의하는 task는 어느 judge가 인간에 가까운지 알려주지 못하므로, 131개 tractable task에서 두 judge가 모두 score spread가 큰 경우를 남기고 가장 disputed한 서로 다른 10 paper를 선택했다.

76 rankings, 19 participants의 disputed pair에서 인간은 rubric judge 쪽을 63% 선택했지만 mixed-effects model의 \(p=0.109\)였다. 방향은 rubric judge에 유리하지만 유의한 증거는 아니다.

F.2 Agent comparison

이 study는 질문이 다르다. rubric judge가 Faraday를 두 baseline보다 0.2 이상 높게 평가한 triplet만 골라, 사람도 그 뚜렷한 우위를 동의하는지 본다. 41 rankings, 11 participants에서 사람은 Faraday를 Claude보다 80%, Codex보다 88% 선호했고, 둘 모두보다 위로 둔 비율은 71%였다. 모두 \(p<0.01\)이다.

Do not overclaim

이 설계는 “rubric judge가 Faraday의 clear advantage를 말할 때 인간도 동의하는가?”만 답한다. random task에서 사람의 평균 선호가 Faraday 쪽이라는 결론은 낼 수 없다. 논문이 이 경계를 명시한다.

F.1 judge-comparison에 쓰인 10개 task
  • A Generalist Agent · Fig.5 (Gato)
  • Asynchronous Methods for Deep RL · Fig.3 (A3C)
  • Auto-Encoding Variational Bayes · Fig.2 (VAE)
  • Evolution through Large Models · Fig.1 (ELM)
  • Exploring Strategies for Training Deep Neural Networks · Fig.9
  • Gradient-Based Learning Applied to Document Recognition · Fig.12 (LeNet)
  • Learning Precise Timing with LSTM · Fig.8
  • SMOTE · Fig.23
  • Scaling In-Context Online Learning via Cross-Episode Meta-RL · Fig.1
  • The AI Scientist · Fig.2
F.2 agent-comparison의 29개 task inventory

ML train (18)

  • A Generalist Agent · Fig.5
  • Additive Logistic Regression · Fig.1
  • Asynchronous Methods for Deep RL · Fig.4
  • Automated Design of Agentic Systems · Fig.3
  • Darwin–Gödel Machine · Fig.4
  • Diversity is All You Need · Fig.6
  • Dropout · Fig.4
  • Evolution through Large Models · Fig.15
  • Gradient-Based Learning Applied to Document Recognition · Fig.12
  • Greedy Function Approximation · Fig.3
  • HOGWILD! · Fig.3
  • ImageNet Classification with Deep CNNs · Fig.1
  • Manifold Regularization · Fig.5
  • Manifold Regularization · Fig.8
  • Meta-Learning Backpropagation And Improving It · Fig.5
  • Scaling In-Context Online Learning · Fig.1
  • The AI Scientist · Fig.4
  • Toolformer · Fig.4

AI-for-science test (11)

  • Foundational LLMs for Materials Research · Fig.3
  • A Foundation Model for the Earth System · Fig.2
  • A Generative Model for Inorganic Materials Design · Fig.2
  • AlphaFold 3 · Fig.4
  • CLOUD · Fig.2
  • FourCastNet · Fig.1
  • FourCastNet · Fig.4
  • GraphCast · Fig.2
  • GraphCast · Fig.4
  • MACE · Fig.3
  • Scaling Deep Learning for Materials Discovery · Fig.2

14 · Prompts & rubrics

Appendix G는 이 연구가 ‘정직한 축소 실험’을 어떻게 operationalize했는지 보여준다

논문의 prompt는 단순한 지시문이 아니라 scientific integrity를 executable policy로 바꾸려는 시도다. 아래는 Appendix G의 모든 핵심 내용을 기능별로 정리한 것이다.

G.1 Faraday system prompt
  • Role: coder가 아니라 researcher. 먼저 깊이 생각하고 계획하며 coding agent에 구현을 위임한다.
  • Tools: shell, apply_patch, read_file, list_dir, grep_files. 긴 작업은 background job으로 돌려 idle waiting을 피한다.
  • Coding agent: coding_agent.py는 기본적으로 이전 session을 이어가고, fresh session과 budget check를 지원한다. 거대한 한 번의 지시보다 작은 단위의 반복 호출을 권한다.
  • Workflow: plan first → iterative execution → autonomous persistence → time budget monitoring. clarification을 요구하지 않고 합리적 결정을 한다.
  • Authenticity: 실험을 simulate/fabricate/hard-code하지 않는다. full scale이 불가능하면 smaller model/fewer steps/fewer seeds를 명시적으로 기록한 faithful scale-down만 허용한다.
  • GPU: GPU task라면 CUDA를 사용하고 nvidia-smi로 자원을 확인한다. inner coding agent에는 GPU와 필요한 환경 정보를 별도 전달한다.
  • Files: working directory는 /home/agent/task, 필수 결과물은 plot.pngwriteup.md다.
G.2–G.3 Baseline 및 Replica task prompt
  • Claude/Codex baseline은 각 CLI built-in system prompt에 “prompt.md를 읽고 task를 완료하라”는 초기 user prompt를 붙인다. CAT의 Codex 초기 prompt는 Faraday가 정한다.
  • task는 missing plot을 real experiments로 재생성하고, 구현·축소 선택·관찰을 writeup.md에 기록해야 한다.
  • 1시간 budget은 check_time.sh로 확인하며, productive idea가 남아 있으면 budget을 활용하되 busywork는 하지 않는다.
  • MIG 자원을 nvidia-smi로 확인하며, frontier LLM/Hugging Face access credential이 환경변수로 제공된다. 글에서는 보안상 값은 다루지 않는다.
  • 원 paper PDF를 인터넷에서 다시 받거나, 해당 paper를 위한 기존 implementation을 가져오는 것은 금지된다. 반면 cited work/framework 같은 일반 자원은 쓸 수 있다.
  • paper의 core novelty는 직접 구현해야 하며, 비핵심 부분은 library를 쓸 수 있다. exact datapoint보다 claim과 trend 재현이 중요하다.
  • 처음 git repository를 만들고 입력 파일을 commit하며, plot/code를 수정할 때마다 commit한다. writeup.md는 초기에 만들고 계속 갱신한다.
G.4 Human rater guide
  • 원 그림의 색·축·layout exact match를 요구하지 않는다. experimental setting, scientific approach, implementation, outcome을 본다.
  • rater는 agent instructions, materials PDF, gold figure/caption, produced plot/writeup, trajectory transcript, generated GitHub repository를 확인한다.
  • 먼저 task를 요약하고 rollout을 best→worst로 순위화하며, 각 선택과 전체 판단에 구체적 rationale을 적는다.
  • 모델 identity는 공개하지 않는다.
G.5 Prompt-optimised Codex가 배운 체크리스트
  • 코딩 전에 panels/axes/legend/units/claim/conditions/constants를 정확히 적고 final figure와 diff한다.
  • proxy, oracle, tuned prior로 빠지지 말고 실제 mechanism을 train한다. full task가 불가능해도 최소 1×1 real slice를 anchor로 실행한다.
  • scale-down은 claim을 검증하는 property를 보존하고 breadth를 줄인다. 결과를 본 뒤 seed/window/stopping point를 고르지 않는다.
  • direction뿐 아니라 magnitude도 재현하려 노력하되, 불가능하면 honest miss를 보고한다.
  • 남은 시간이 많다면 real slice, missing arm/panel, weak condition, seed/error bar 순서로 개선한다. prompt는 ≥3 seeds/runs를 권고한다.
  • axis label은 실제 수행한 scale을 반영하고, writeup의 모든 숫자를 final code/CSV/log에서 확인한다.
  • deliverables는 plot, runnable code, results CSV, writeup이며 real-slice와 used-budget attestation을 남긴다.

24-generation prompt optimisation이 이 failure modes를 문장으로 잘 포착했어도 Codex score는 train 0.796→0.802, test 0.729→0.725로 실질적 개선이 없었다. 저자들은 post-training gain이 prompting만으로는 도달되지 않았다고 해석한다.

G.6 세 개의 example rubric
Zucchet et al. Fig.5

Facts, hallucination, replay

3-panel synthetic-biography experiment를 요구한다. pretraining 중 knowledge와 wrong-answer overconfidence의 동시 출현, new-individual fine-tuning의 catastrophic forgetting, replay의 부분 완화를 visual/claim/implementation/effort 네 축에서 0/0.5/1 예시로 채점한다. confidence-on-wrong signal이 핵심이고 단순 accuracy proxy는 충분하지 않다.

Friedman et al. Fig.5

LogitBoost on nested spheres

10-D standard normal과 \(\|x\|^2\)의 \(\chi^2_{10}\) median threshold를 쓰는 nested-sphere data에서 stump 기반 LogitBoost의 10개 coordinate function을 요구한다. 각 \(f_j(x_j)\)가 대칭의 roughly quadratic 형태를 회복하는지가 claim이다.

Gers et al. Fig.4

Peephole vs traditional LSTM

NMSD task에서 minimum spike interval \(F\)에 따른 average training streams를 비교한다. peephole LSTM이 traditional forget-gate LSTM보다 특히 큰 \(F\)에서 효율적으로 precise timing을 학습하는지 본다. 실제 cell-to-gate peephole connection과 동일 stopping criterion이 필요하다.

각 rubric은 visual fidelity, claim reproduction, implementation fidelity, experimental effort에 대해 실패·부분성공·성공 사례를 구체적으로 적는다. 결과가 source claim과 다르면 숨기지 않고 명시하는 것도 고득점 조건이다.

15 · Scaling, contamination, future task space

Replica가 커질수록 더 어려워지는 문제는 task 생성이 아니라 ‘복제되지 않는 연구’를 다루는 판단이다

Appendix D.1에서 저자들은 일부 paper와 figure가 frontier multimodal model의 pretraining data에 들어갔을 가능성을 사실상 인정한다. 대신 원 figure를 만들어낸 process data는 기록조차 남지 않은 경우가 많고, Replica의 time/compute condition도 원 연구와 다르므로 연구대상은 figure recall보다 replication process라고 주장한다. figure redaction은 current context에서 plot을 제거하고 원 plot을 인터넷에서 역공학하는 cheating도 더 쉽게 탐지하기 위한 장치다.

이 논리는 contamination을 ‘없앴다’는 뜻은 아니다. Figure 4의 recency effect를 해석할 때도 pretraining familiarity가 하나의 가능한 요인으로 남는다.

Appendix E는 scale의 다음 단계를 제시한다. ICML·ICLR·NeurIPS accepted papers만으로 연간 약 36,000 task를 만들 수 있다는 저자 추정이다. 그러나 규모가 커지면 정말 재현되지 않는 paper가 섞인다. 현재 corpus가 유명하고 높이 인용된 연구에 치우쳐 있어 이 위험에 비교적 덜 노출됐지만, 미래에는 judge가 non-replicability 자체를 알아보고 agent가 실패를 강건하게 시험하고 정직하게 보고할 수 있어야 한다.

다른 scale 축도 있다. base model을 한 order 키우거나 multimodal model로 바꾸면 figure understanding이 좋아질 수 있다. CAT가 outer harness를 금지하는 것도 아니다. training time에 outer harness를 inference-time improvement operator로 써 더 좋은 trajectory를 만들고 그것에서 학습할 수 있다.

16 · Appendix H

Faraday는 한 개의 agent가 아니라, 대규모 비동기 RL 시스템 위에서 훈련된다

cluster는 Hopper·Blackwell GPU Kubernetes 환경이다. Kueue가 whole GPU, MIG slice, CPU-only node의 별도 quota와 workload priority를 관리한다. training run은 Ray job으로 시작해 trainer와 generation node를 포함한 RayCluster를 만든다. 자체 launch utility가 declarative experiment spec을 Kubernetes workload로 변환하고 로그·metadata를 추적한다.

RL framework는 NeMo-RL fork다. rollout collection과 optimisation은 서로 다른 node pool에서 겹쳐 실행되며 Ray가 orchestration과 communication을 담당한다. trainer는 Megatron-Core를 사용해 128K context에 tensor/context parallelism을 적용하고, inference는 vLLM으로 serving한다. optimiser step이 들어오면 policy weight가 in-place로 다시 fit되어 in-flight rollout이 더 새 weight를 이어받는다. Qwen3.6 hybrid gated-delta-net layer에는 sequence packing과 context parallelism support를 구현했다.

rollout은 NeMo-Gym fork의 model/agent/resource HTTP service를 지나간다. custom resource server는 rollout마다 fresh container pod를 만들고 workspace staging, wall-clock deadline, tool routing, session reaping을 담당하며 evaluation에서는 judge도 container 안에서 실행한다. 즉 ‘사람 연구자의 workstation에 가까운 환경’을 수십만 turn 규모로 반복 생성하는 infrastructure가 논문의 숨은 절반이다.

17 · Limits, ethics, community

Faraday가 실패했다고 논문이 틀렸다는 뜻은 아니다

Ethics statement의 첫 문장은 사실상 이 연구를 사용하는 방법에 대한 경고다. Faraday가 어떤 paper를 복제하지 못해도 원 연구의 결과가 잘못되었다고 결론내릴 수 없다. authors는 rigorous하고 honest하게 얻어진 것으로 믿는 결과에서도 Faraday가 실패한 사례가 있다고 명시한다. 장차 agent가 replicability judge로 충분히 강해져도 인간이 replication skill을 유지하고 agent output을 검사해야 한다고 강조한다.

human study는 professional judgement만 수집하고 민감정보·위험이 없다고 내부적으로 판단해 external board review가 필요하지 않다고 결론냈다. participants는 기존 professional network와 third-party provider를 통해 모집했고, 내부 filtering 통과 여부와 무관하게 보상했다.

conflict of interest도 공개한다. corpus에는 저자 본인과 지인의 논문이 있고, 연구에 사용한 commercial model의 기관 논문도 있다. 저자들은 전체 corpus에 동일한 자동 pipeline과 scoring treatment를 적용했다고 적는다.

technical safety 측면에서는 automated scientific insight가 악의적 사용이나 misaligned system의 위험을 키울 수 있음을 인정한다. 이번 연구는 in-silico, 저위험이라고 판단한 task만 선택하고 time/compute를 제한했으며 physical lab equipment는 제공하지 않았다. 인터넷 access는 있었다.

Real-world feedback

Replica에 포함된 네 논문의 원 저자에게 초기 feedback도 받았다. 일부는 replication fidelity와 toy-task 설계를 긍정적으로 보았지만, 너무 쉬운 축소문제, 좋지 않은 설명문, 불필요하게 복잡한 코드에 대한 비판도 있었다. 즉 automated score가 높다는 사실과 원 연구자가 ‘좋은 replication’이라고 느끼는 것은 여전히 완전히 같은 개념이 아니다.

저자들은 replication을 public good으로 본다. AI-assisted research가 늘며 peer review가 압박받는 시점에 고품질 replication agent가 AI-assisted review를 더 실증적으로 ground할 수 있다는 전망도 제시한다.

Acknowledgements

초기 manuscript에 의견을 준 Shi Dong, Alex Goldie, Matt Henderson, Akarsh Kumar, Chris Lu, Clare Lyle, Jimmy Secretan과, replication quality에 feedback을 제공한 Sergio Gomez, José Miguel Hernández-Lobato, Chris Lu, Matthias Rupp에게 감사를 표한다.

18 · Interpretation

이 논문이 훈련한 것은 ‘AI Scientist’라는 직함보다 research taste의 작은 조각이다

연구 자동화는 흔히 두 방향으로 간다. 하나는 reward가 명확한 문제를 만들어 search를 오래 돌리는 것이다. FunSearch·AlphaEvolve의 계보다. 다른 하나는 scientific method를 여러 역할 agent로 나눠 workflow를 정교하게 설계하는 것이다. Faraday는 그 사이에 다른 선택지를 놓는다. harness를 복잡하게 만들기보다, 다양한 underspecified replication task에서 ‘어떤 다음 행동이 좋은 연구인가’를 policy에 학습시킨다.

이 선택은 세 가지 의미가 있다. 첫째, reward가 완전히 verifiable하지 않아도 RL을 할 수 있는가라는 질문에 rubric judge + multi-sample aggregation + credit assignment라는 구체적 recipe를 제시한다. 둘째, 작은 outer model이 큰 coding model을 도구로 사용하며 성능을 높이는 CAT라는 orchestration 관점을 보여준다. 셋째, replication을 innovation의 curriculum으로 본다. 정답이 가려진 paper를 따라가는 데서 시작해, dataset이나 claim이 바뀐 counterfactual problem으로 모호성을 늘린다.

동시에 아직 ‘AI가 과학자가 되었다’고 말할 근거는 부족하다. test task 수는 68개이고, human preference study는 clear-margin subset에 조건부이며, imagined innovation judge는 인간 검증이 없다. full-scale test도 8개 task, 1 rollout씩이다. pretraining contamination 가능성도 남는다. judge는 더 일관되지만 인간과의 Kendall correlation 자체는 낮다.

논문의 가장 설득력 있는 문장은 ‘AI가 과학을 한다’가 아니다. 좋은 연구는 결과의 모양보다, 결과를 얻는 과정에서 어떤 타협을 거부하느냐에 달려 있다는 주장이다.

Strength

Process-level supervision

그림 exact-match보다 mechanism, claim, effort, integrity를 reward에 포함한다.

Strength

OOD task split

ML train에서 AI-for-science test로 분야를 바꿔 transferable research behaviour를 시험한다.

Caution

Judge dependence

핵심 score가 Codex-based rubric judge에 의존하고 human agreement는 제한적이다.

Caution

Conditional human study

Faraday 평균 human preference가 아니라 judge가 큰 우위라고 본 subset의 동의율이다.

Open question

Non-replicable papers

task space를 확장하면 진짜 실패를 agent failure와 구분해야 한다.

Open question

Innovation

replication에서 배운 taste가 새 hypothesis와 experiment design으로 얼마나 이전되는지는 아직 시작 단계다.

19 · References

연구 계보와 원 논문의 참고문헌

원 논문은 pages 13–23에 reproducibility, AI research agents, rubric rewards, long-horizon RL, tool orchestration, AI-for-science 및 Replica task의 원 연구를 아우르는 전체 bibliography를 수록한다. 아래에는 이 게시물의 논지를 직접 구성하는 주요 계보를 정리한다.

주요 참고문헌
  1. Abramson et al. (2024), Accurate structure prediction of biomolecular interactions with AlphaFold 3.
  2. Kapoor & Narayanan (2022), leakage and the reproducibility crisis in ML-based science.
  3. Semmelrock et al. (2025), reproducibility in machine-learning-based research.
  4. Starace et al. (2025), PaperBench.
  5. Kim et al. (2025), from reproduction to replication with progressive code masking.
  6. Hua et al. (2025), ResearchCodeBench.
  7. Kon et al. (2025), EXP-Bench.
  8. Xiang et al. (2025), SciReplicate-Bench.
  9. Seo et al. (2026), Paper2Code.
  10. Gaddipati et al. (2026), MLReplicate.
  11. Qiu et al. (2026), PRBench.
  12. Liu et al. (2026), VERITAS.
  13. Lu et al. (2024), The AI Scientist.
  14. Gottweis et al. (2025), Towards an AI co-scientist.
  15. Ghafarollahi & Buehler (2025), SciAgents.
  16. Ghareeb et al. (2026), a multi-agent system for automating scientific discovery.
  17. Novikov et al. (2025), AlphaEvolve.
  18. Romera-Paredes et al. (2024), mathematical discoveries from program search.
  19. Karpathy (2026), autoresearch.
  20. Wijk et al. (2025), RE-Bench.
  21. Chan et al. (2025), MLE-bench.
  22. Nathani et al. (2025), MLGym.
  23. Goldie et al. (2026), procedural generation of algorithm discovery tasks.
  24. Gunjal et al. (2025), rubrics as rewards beyond verifiable domains.
  25. Goel et al. (2025), training AI co-scientists using rubric rewards.
  26. Shen et al. (2026), rubric generation for open-ended tasks.
  27. Viswanathan et al. (2026), checklists for aligning language models.
  28. Shao et al. (2024), GRPO / DeepSeekMath.
  29. Yu et al. (2025), DAPO.
  30. Ling Team (2025), token-discrepancy control in large-scale RL.
  31. Xie et al. (2026), turn-level information-potential reward shaping.
  32. Su et al. (2025), ToolOrchestra.
  33. Nielsen et al. (2026), natural-language agent orchestration.
  34. Kenton et al. (2024), scalable oversight with weak LLMs judging strong LLMs.
  35. Amodei et al. (2016), concrete problems in AI safety.
  36. Stanley & Lehman (2015), Why Greatness Cannot Be Planned.
  37. Deutsch (2011), The Beginning of Infinity.

그 밖의 고전 ML, AI-for-science, task-source papers, infrastructure 및 RL references도 원 논문의 전체 bibliography를 검토해 본문에 반영했다.

Primary source

Damon Falck, Samer Sabri, Anja Surina, Thom Foster, Anya Sims, Sam Devlin, Dylan Rogers, Tantum Collins, Kaloyan Aleksiev, Louis Kirsch, Edward Hughes. Training AI Scientists to Replicate Research. Inherent, 2026. arXiv:2608.13331v1.