AI Research Blog · AGI / RSI Measurement2026-09-21
One New Signal · From Benchmarks to Frontier-Lab Operations

RSI를 “성능”이 아니라 “연구개발 운영”으로 측정하기 시작했다

Measuring System-Centric RSI: AI R&D Automation, Research Judgment, and Oversight Capacity

PROBLEMSELECTIONEXPERIMENTDESIGNIMPLEMENTATIONEVALUATIONDEPLOYMENTR&DAUTOMATIONRESEARCHJUDGMENTOVERSIGHTCAPACITYSYSTEM-CENTRIC RSI · OPERATIONAL MEASUREMENT FRAMEWORK

이번 업데이트의 가장 중요한 변화는 Recursive Self-Improvement를 개별 agent의 benchmark 개선이 아니라, 실제 frontier AI 연구소의 R&D value chain에서 AI가 담당하는 비율로 측정하기 시작했다는 점이다.

Anthropic의 내부 지표는 “RSI가 달성됐다”는 증거가 아니다. 오히려 차세대 AI 개발에서 자동화가 어디까지 올라왔고, 어디에서 인간 판단과 독립적 감독이 병목으로 남는지를 반복적으로 추적할 수 있는 운영 계량틀에 가깝다. 따라서 이번 자료의 핵심은 성능 숫자 하나보다 측정 단위가 바뀌었다는 사실이다.

Part I · Measurement Shift

“AI가 스스로 개선하는가?”에서 “AI가 AI 개발의 얼마를 수행하는가?”로

RSI 평가단위가 prototype loop에서 실제 연구조직의 전체 가치사슬로 이동한다.

Source factAnthropic Institute는 2026년 9월 17일 Measurements for understanding the pace of AI development inside frontier labs를 공개하며 내부 AI R&D 전반을 대상으로 Anthropic R&D Automation Index를 제시했다. 영역은 Recursive Self-Improvement, Autonomous AI R&D, Long-Horizon Agents, Scalable Oversight에 걸친다.

기존 self-improving agent 연구는 대체로 다음과 같은 단위를 측정했다.

\[Agent_t\rightarrow Self\text{-}Modification\rightarrow Benchmark\rightarrow Agent_{t+1}\]

이번 접근은 실제 AI 개발조직을 다음 R&D value chain으로 분해한다.

\[\text{Problem Selection}\rightarrow\text{Experiment Design}\rightarrow\text{Implementation}\rightarrow\text{Evaluation}\rightarrow\text{Deployment}\]

그리고 각 연구업무가 어떤 automation level에서 수행되는지 person-time 기준으로 추적한다.

\[A(R)=\text{fraction of R\&D performed at each automation level}\]
핵심 연구질문은 “AI가 자기 자신을 고칠 수 있는가?”에서 “차세대 AI를 만드는 전체 과정 중 어떤 부분이 이미 AI에게 넘어갔는가?”로 이동한다.Analysis of the measurement-unit shift
Part II · R&D Automation Index

26%는 ‘완전 자율’이 아니라 AL4 수준의 연구 주도 비율이다

Automation Level을 구분하지 않으면 수치가 쉽게 과장된다. 특히 AL5가 아직 0이라는 사실이 중요하다.

Source factAnthropic은 Epoch AI의 Automation Level(AL0–AL5)을 사용한다. 첨부 자료에서 설명된 핵심 단계는 다음 세 수준이다.

Level의미인간 역할
AL3 · collaboratesAI가 인간의 긴밀한 지시 아래 연구업무의 큰 부분을 수행한다.세밀한 지시와 공동 수행
AL4 · leadsAI가 높은 수준의 지시만 받고 대부분을 end-to-end로 처리한다.감독과 고수준 방향 설정
AL5 · autonomous인간이 필요 없는 완전 자율 단계다.필요 없음

AL4 share

26%

2026년 8월 기준 Anthropic AI R&D에서 Claude가 AL4 수준으로 주도한다고 보고된 비율이다.

At least AL3

90%+

적어도 협업 수준(AL3 이상)으로 AI가 참여한다고 보고된 비율이다.

AL5

0

완전 자율 단계로 측정된 연구업무는 아직 없다고 보고됐다.

Caution26%라는 수치를 “R&D의 26%가 인간 없이 자동화됐다”로 읽으면 잘못이다. 원 자료는 AL4를 인간의 높은 수준 지시와 감독이 남아 있는 단계로 설명하며, AL5 업무는 아직 없다고 명시한다.

이 지표는 어떻게 만들어졌는가

2026년 7월 각 R&D 부서 인력의 20%를 주별로 표본화하고 Slack과 내부 문서에서 약 15,000개의 세부 R&D task를 추출했다. 이를 542-node·378-leaf의 고정 taxonomy로 구조화한 뒤 person-time으로 가중했다.

Weekly sample

20%

각 R&D 부서 인력 표본

Fine-grained tasks

~15k

Slack·내부문서에서 추출

Taxonomy nodes

542

고정 연구업무 taxonomy

Leaf tasks

378

세부 업무 leaf

Claude judge와 인간 reviewer의 automation-level 평가는 정확히 같은 등급에서 59%, 한 단계 이내에서 97% 일치했다.

평가 경계. Anthropic 자체 모델이 Anthropic의 자동화를 평가한다는 점은 독립성 문제를 남긴다. 회사도 외부의 독립 검증이 필요하다고 명시한다.
Part III · Oversight at Scale

자동화율이 오르면, 병목은 인간 작업량보다 검증 처리량으로 이동한다

AI가 AI를 더 많이 만들수록 중요한 것은 agent 수 자체보다 행동을 독립적으로 감시하고 escalation하는 체계다.

Source factAnthropic의 가장 많이 쓰이는 내부 연구 플랫폼에는 2026년 8월 기준 약 30,000개의 research/engineering agent가 동시에 활동한다고 보고됐다. 모든 action은 실행 전 online monitor를 통과하고 실행 후 offline monitor에도 입력된다고 한다.

Concurrent agents

~30k

내부 research/engineering agents

Monthly decisions

1B+

2026년 8월 기준 약 10억 건 이상

Online block rate

0.002%

약 47,000건당 1건

Human escalation

~50/wk

최고 우선순위 transcript

offline monitoring은 주당 약 100,000개 transcript를 추가 classifier 검토 대상으로 올리고, 그중 최고 우선순위 약 50건을 인간에게 escalation한다고 보고했다.

Analysis여기서 중요한 것은 “차단률이 낮으니 안전하다”는 해석이 아니다. 차단률은 정책·탐지기·작업분포에 따라 의미가 달라질 수 있다. 더 중요한 변화는 자동화 측정과 oversight throughput 측정을 같은 운영 프레임 안에서 보기 시작했다는 점이다.

\[\text{Automation Level}+\text{Monitor Coverage}+\text{Review Latency}+\text{Escalation Rate}\]
AI가 AI 개발을 더 많이 수행할수록 안전연구의 병목은 “사람이 모든 작업을 직접 하는가”보다 “수만~수백만 agent의 행동을 얼마나 빠르고 독립적으로 검증할 수 있는가”로 이동한다.System-level interpretation
Part IV · When AI Builds Itself

코딩은 빠르게 자동화되지만, 연구판단은 더 느리게 넘어간다

companion technical report는 자동화량뿐 아니라 open-ended capability와 남은 병목을 내부 시계열로 보여준다.

Source fact9월 18일 업데이트된 When AI builds itself에서는 2026년 9월 기준 Claude Code의 open-ended problem session success가 약 91%까지 상승했다고 보고한다. trivial·routine·substantial task를 포함한 네 유형 모두 약 88–92% 수준으로 수렴했다고 설명한다.

Caution이 성공 여부 역시 Claude judge가 판정한 내부지표다. 따라서 외부 독립 benchmark와 같은 수준의 증거로 취급해서는 안 된다.

Production code

80%+

2026년 5월 기준 병합 코드 중 Claude 작성으로 귀속된 비율

Code output

~8×

2026년 2분기 engineer당 산출량, 2024년 대비

Optimization gain

3× → 52×

잘 정의된 모델 최적화 실험에서 보고된 개선폭 변화

반면 “어떤 연구를 할 것인가”, “어떤 결과를 믿을 것인가”, “언제 접근법을 포기할 것인가” 같은 research taste와 direction-setting은 여전히 인간의 비교우위라고 Anthropic은 평가한다.

\[\text{coding}\rightarrow\text{experiment execution}\rightarrow\text{research judgement}\]

Analysis이 시퀀스는 자동화가 단순히 더 긴 task로 진행되는 것이 아니라, 구현에서 실행으로, 다시 연구판단으로 병목이 이동하는 과정으로 볼 수 있음을 보여준다.

Part V · Research Judgment

AGI/RSI 평가는 ‘긴 작업 수행’보다 ‘좋은 연구판단’으로 이동해야 한다

남은 차이는 tool-call 길이가 아니라 문제 선택, 판별적 실험, 반대증거 처리, 중단 판단, 감사가능성에 있다.

첨부 자료가 제시하는 다음 평가축은 다음 다섯 질문으로 요약된다.

\[\begin{aligned}&\text{Can it choose worthwhile problems?}\\&\text{Can it design discriminating experiments?}\\&\text{Can it reject misleading evidence?}\\&\text{Can it decide when to stop?}\\&\text{Can these decisions be independently audited?}\end{aligned}\]

Automation is not judgment

많은 코드를 쓰고 실험을 실행할 수 있어도, 잘못된 연구질문을 고르면 전체 cycle은 빠르게 틀릴 수 있다.

Judgment needs auditability

문제선택·실험설계·중단결정은 자연어 자기보고보다 외부에서 재구성 가능한 근거와 로그가 필요하다.

Inference따라서 미래 RSI benchmark는 단순 success rate보다 problem-selection quality, experiment discriminativeness, evidence rejection accuracy, stop/go calibration, independent auditability 같은 판단 지표를 포함할 필요가 있다.

Part VI · System-Centric RSI

RSI는 자동화율 하나가 아니라 세 축의 결합으로 측정해야 한다

R&D automation, research judgment, oversight capacity를 함께 보아야 실제 self-improvement substrate의 성숙도를 판단할 수 있다.

\[\textbf{RSI}=\textbf{R\&D Automation}+\textbf{Research Judgment}+\textbf{Oversight Capacity}\]

이 표현은 현재 증거를 가장 과장 없이 통합한다. R&D Automation은 AI가 실제 개발 value chain에서 얼마나 많은 person-time과 task ownership을 가져가는지 묻는다. Research Judgment는 가치 있는 문제, 판별적 실험, 신뢰할 증거와 중단시점을 고를 수 있는지 묻는다. Oversight Capacity는 이 모든 행동을 독립적으로 감시·검증·escalate할 수 있는지를 묻는다.

현재 관찰된 신호남은 핵심 불확실성
R&D AutomationAL4 26%, AL3 이상 90%+, code·optimization 작업의 빠른 자동화다른 연구소에서도 재현되는가, 외부 독립 평가와 일치하는가
Research Judgmentresearch taste·direction-setting은 여전히 인간 우위라고 내부 평가문제선택·반증수용·stop/go 판단을 객관적으로 어떻게 측정할 것인가
Oversight Capacityonline/offline monitor, 대규모 transcript triage, human escalation 운영agent 규모 증가보다 monitor 성능·독립성·review latency가 충분히 빨리 개선되는가

Epistemic boundary이번 자료는 recursive self-improvement가 달성됐다는 증거가 아니다. 오히려 그 지점까지의 거리를 반복 측정할 수 있는 계량틀이 실제 frontier-lab 운영자료에 적용되기 시작했다는 증거에 가깝다.

Inference향후 다른 연구소가 동일하거나 호환 가능한 Automation Level 체계와 독립 제3자 검증을 채택한다면, AI-R&D Automation Index는 ARC-AGI score나 METR time horizon과 다른 축에서 AGI 진척을 추적하는 지표군으로 발전할 수 있다. 다만 그 지표가 의미를 가지려면 공통 taxonomy, 독립 judge, monitor coverage 정의, review latency와 escalation protocol이 함께 표준화돼야 한다.

System-Centric RSI의 핵심은 “AI가 얼마나 많은 일을 하는가”가 아니다. “AI가 더 많은 AI 개발을 수행할수록, 그 연구판단과 행동을 독립적으로 검증하는 역량도 같은 속도로 확장되는가”이다.Final synthesis
References

Source Set

01
Measurements for understanding the pace of AI development inside frontier labs
Anthropic Institute · 2026-09-17

anthropic.com/institute/measuring-pace-of-ai-development

02
When AI builds itself
Anthropic Institute · companion technical report · updated 2026-09-18

anthropic.com/institute/recursive-self-improvement