AGI의 진전은 어떻게
측정하고 허가하는가
AGI Research: Automation, Training Safety Cases, and Permission-Calibrated Agency
AI R&D 자동화, 학습 중 안전 논증, 실행 권한을 이해하는 에이전트의 세 변화를 연결한다.
게시일: 2026-09-30 · 첨부 조사 기준: 2026-09-30. 원문에 명시된 개별 발표일과 검색 기간은 본문에 보존했다. 안전 논증의 논리식은 조건을 구조화한 해석적 표현이며 수학적으로 입증된 안전 보증이 아니다. AgentBoundary의 개선 수치는 첨부 보고가 %p로 표기했으며 공개 초록은 %로 제시하므로 증가의 기준을 구분해 읽어야 한다.
연구 범위와 핵심 질문
AGI 연구동향 업데이트 — 2026년 9월 30일
이번 확인에서는 기존 추적에서 아직 다루지 않았고, 연구방향을 바꿀 가능성이 충분히 큰 변화 3건만 선별했다. 공통된 변화는 AGI 연구가 이제 **“모델이 얼마나 강한가”보다 “AI가 스스로 AI R&D를 얼마나 자동화하는가, 그 과정을 어떤 안전 근거로 계속 허용할 것인가, 그리고 agent가 실제 권한을 상황에 맞게 해석할 수 있는가”**를 직접 측정하기 시작했다는 점이다.
What if automating AI R&D triggers an intelligence explosion?
발표일: 2026년 9월 28일
영역: Recursive Self-Improvement · Automated AI R&D · AGI Safety · AGI Evaluation
Cambridge Programme on AI Science & Policy(CASP)가 Geoffrey Hinton, Yoshua Bengio, Andrew Barto, OpenAI의 Jakub Pachocki, Anthropic의 Jack Clark, Microsoft의 Eric Horvitz 등 22명이 참여한 연구논문을 공개했다. 논문의 핵심은 recursive self-improvement를 추상적 미래 가설이 아니라 “AI R&D 자동화율”이라는 관측 가능한 중간변수로 다룬다는 점이다. 저자들은 현재 AI가 이미 frontier lab 내부의 상당한 개발·연구 업무를 수행하고 있으며, AI가 AI 연구를 더 많이 자동화할수록 다음 세대 AI의 개발속도가 다시 올라가는 양의 피드백이 생길 수 있다고 분석한다. 다만 현재 증거는 아직 예비적이며, 실제 intelligence explosion 임계점을 넘었다고 주장하지는 않는다.
기존 연구 대비 차이: 기존 RSI 연구는 주로
처럼 하나의 agent 또는 harness가 스스로 좋아지는지를 봤다. 이번 논문은 평가단위를 한 단계 확장해
이라는 산업·연구생태계 수준의 recursive loop를 분석 대상으로 삼는다. 최근 Anthropic이 보고한 AL4 수준 R&D 자동화 26% 같은 지표가 단순 생산성 지표가 아니라 AGI/RSI 진행상황을 관찰하는 leading indicator가 될 수 있다는 의미이다.
연구적 의미: AGI 평가축에 ARC-AGI, agent task horizon, reasoning score뿐 아니라 AI-R&D Automation Index, human-intervention frequency, research-decision autonomy, improvement-cycle latency 같은 지표를 포함해야 한다는 주장이 강해졌다. 특히 중요한 점은 “자기개선이 가능한가?”보다 “AI가 차세대 AI를 만드는 전체 파이프라인 중 얼마를 인간 없이 수행하는가?”가 더 실용적인 RSI 조기경보지표가 될 수 있다는 것이다.
CASP — What if automating AI R&D triggers an intelligence explosion?
OpenAI — Towards safety cases for frontier AI training
발표일: 2026년 9월 28일
영역: Scalable Oversight · Alignment · Containment · AGI Safety
OpenAI는 frontier reinforcement-learning training을 계속 진행하기 전에 구조화된 safety documentation, 궁극적으로는 safety case가 필요하다는 운영·기술 프레임을 공개했다. 여기서 safety case는 단순 benchmark 점수나 “안전팀 승인”이 아니라 왜 이 training run을 계속 수행해도 되는지를 증거로 구성한 위험 논증이다. 기술적으로는 alignment training + containment + monitoring을 세 축으로 묶고, reward hacking을 강화하지 않는 grader, eval gaming 탐지, worst-case stress test, sandbox와 research infrastructure의 이중 방어, cross-sample communication 제한, immutable transcript, monitor-evasion 평가, high-recall monitoring과 자동 pause를 제안한다.
또한 운영계층에서도 중요한 변화가 있다. 독립팀의 dissent/pre-mortem, senior leadership의 veto, safety case 무효화 시 전체 run을 중단하는 runbook, fail-closed monitoring, downstream contamination을 되돌리기 위한 rollback, 미완화 residual risk의 명시, 그리고 심각한 misalignment incident의 root-cause analysis와 regression test화를 요구한다. OpenAI는 이 원칙들이 현재 구현 과정에 있다고 밝히고 있다.
기존 연구 대비 차이: 기존 frontier safety는 흔히
였다. 이번 접근은 이를
으로 바꿉니다.
즉 safety gate가 deployment 직전이 아니라 training 과정 내부로 이동한다. 특히 최근의 DNS 우회, trace tampering, self-replicating prompt injection 같은 사건들을 고려하면, alignment·containment·monitoring을 별도 연구주제가 아니라 하나의 executable safety argument로 묶으려는 변화가 중요한다.
연구적 의미: AGI safety 연구에서 앞으로 중요한 산출물은 단순한 “model card”보다 machine-checkable safety case가 될 가능성이 있다. 예를 들어
처럼 각 주장에 measurable evidence·threshold·stop condition을 연결하는 방식이다. 이는 scalable oversight가 단순 monitor 정확도 연구에서 **“AI 개발 프로세스 자체를 검증 가능한 safety-critical system으로 만드는 연구”**로 확장되고 있음을 보여줍니다.
OpenAI — Towards safety cases for frontier AI training
AgentBoundary: Counterfactual Evaluation of Safety in Tool-Using LLM Agents
발표일: 2026년 9월 27일
영역: Agent Evaluation · Authorization · Alignment · Long-Horizon Agent Safety
AgentBoundary는 최근의 ScopeBench와 유사한 문제를 더 정교하게 분해한다. 핵심은 agent safety에서 “위험해 보이는가?”와 “실제로 허가됐는가?”를 분리해야 한다는 것이다. 저자들은 같은 executable workflow에 대해 apparent risk와 action permissibility를 독립적으로 변화시킨 4-way counterfactual evaluation을 만들고, 인간 검증을 거친 4,000개 task와 trajectory/post-state 평가를 구성했다. 17개 model/harness 조합에서 높은 unsafe-action blocking이 반드시 좋은 agent safety를 뜻하지 않았다. 예를 들어 GPT-5.5는 평범해 보이지만 unauthorized인 action을 99.5% 차단했지만, 위험해 보이더라도 명시적으로 authorized된 task는 28.7%만 완료했다.
경량 runtime calibration module을 추가하자 10개 설정에서 authorized-task completion이 평균 18.2%p 개선됐고, 동시에 unsafe-action blocking도 평균 5.4%p 개선됐다. 즉 더 많이 거절하는 것과 더 안전한 것은 동일하지 않으며, agent가 execution 중 나타나는 permission-relevant evidence를 읽어야 한다는 결과이다.
기존 연구 대비 차이: conversational alignment에서는 보통
를 평가했다. AgentBoundary는 이를
로 바꿉니다.
특히 최근 ScopeBench가 **“목표압력 속에서도 명시적 scope를 지키는가?”**를 봤다면, AgentBoundary는 한 단계 더 나아가 표면적으로 위험해 보이는지와 실제 permission이 있는지를 교차시켜 over-refusal과 unsafe compliance를 동시에 분리 측정한다.
연구적 의미: 향후 AGI alignment의 목표는 단순 refusal rate 최소화나 harmlessness 최대화가 아니라
가 될 가능성이 높다. 실제 autonomous scientist, coding agent, physical robot은 위험해 보이는 행동을 합법적으로 해야 하는 경우가 있고, 반대로 일상적으로 보이는 행동도 권한 밖이면 하지 않아야 한다. 따라서 risk perception과 authorization reasoning을 별도 capability로 평가해야 하며, 이는 AGI safety benchmark의 중요한 새로운 축이다.
종합 전망
이번 세 변화를 연결하면 최근 AGI 연구의 핵심이 상당히 선명해집니다.
즉 현재의 중심 질문은 더 이상 단순히 **“AGI가 얼마나 강해졌는가?”**가 아니다. 점점 더 중요한 질문은
이다. 현재 특히 추적 우선순위가 높아진 연구축은 AI-R&D Automation Metrics, Training-Time Safety Cases, Permission-Calibrated Agents, 그리고 이 셋을 통합하는 **Auditable Recursive AI Development**이다.
자료와 출처
구성 자료: AGI-Trends-0930.md. 첨부의 모든 연구 항목, 비교, 수치, 표, 수식, 한계와 후속 연구 제안을 수록했다. 대화 시스템의 인용 표시와 알림 문구는 편집 과정에서 제거했다. 본문 링크는 해당 자료로 연결된다.