AI Research Blog · AGI Safety · Capability Security2026-09-22
Two New Signals · From Alignment to Capability Security

안전한 생각만 요구하는 대신, 위험한 효과 자체를 실행할 수 없게 만든다

Capability-Secure AGI: Model-Independent Authorization, Revocable Delegation, and Quiescence-Proven Agents

CONCEPTUAL ARCHITECTURE · NOT A MEASURED CHARTAGENTREQUESTDETERMINISTICAUTHORIZATIONEXACT ACTIONBINDINGTOOL /PROVIDERPROTECTEDEFFECTdelegation provenance → revocation → quiescence proofMODEL INTELLIGENCE ≠ EXECUTION AUTHORITY

이번 업데이트의 핵심은 AGI safety의 단위가 모델의 의도·추론에서 실행 권한과 권한 회수 메커니즘으로 이동하고 있다는 점이다. 모델이 위험한 요청을 만들어도 실행 직전의 deterministic gate가 거부하고, 이미 위임된 권한은 중단 이후까지 추적해 소멸시킨다.

APort Vault는 모델과 독립적인 사전 권한검사의 효과를 공격 중심 benchmark에서 측정한다. Authorization Revocation 연구는 더 긴 시간축에서, 이미 흩어진 delegation·queue·callback·provider operation이 중단 뒤에도 남지 않았음을 어떻게 증명할 것인지 정식화한다. 두 연구를 함께 읽으면 AGI safety가 alignment만의 문제가 아니라 검증 가능한 권한·실행 운영체제의 문제로 확장되는 흐름이 보인다.

Part I · Shift

“안전하게 행동하라”에서 “위험한 효과를 만들 권한이 없다”로

행동 정렬과 실행권한 통제는 서로 다른 안전계층이다. 최근 연구는 이 둘을 분리해 설계하기 시작한다.

Source fact이번 추적에서 선별된 두 연구는 모두 2026년 9월 18일 공개됐으며, Long-Horizon Agents·Scalable Oversight·Authorization·AGI Safety를 다룬다.

Analysis기존 안전논의는 모델이 위험한 행동을 계획하거나 요청하지 않도록 만드는 데 무게를 두었다. 이번 자료가 보여주는 변화는 그 위에 모델의 reasoning 결과와 실제 protected effect 사이에 독립적인 권한 substrate를 둔다는 것이다.

\[ \text{Model Intelligence}\neq\text{Execution Authority} \]

이 구분은 더 높은 모델 성능이 곧 더 넓은 권한으로 이어져야 한다는 가정을 거부한다. 금융결제, 실험장비, 로봇, 클라우드, 데이터베이스처럼 되돌리기 어려운 작업에서는 “무엇을 생각했는가”보다 “어떤 action을 실제로 실행할 수 있는가”가 별도의 설계변수가 된다.

Alignment reduces unsafe intent. Capability security constrains unsafe effect.Integrated interpretation of the two source studies
Part II · APort Vault

모델을 믿지 않아도 되는 deterministic authorization layer

결제 agent의 정책 준수를 모델의 자기통제나 LLM judge에 맡기지 않고 실행 직전에 기계적으로 강제한다.

Source factAPort Vault: Benchmarking AI Agent Payment Authorization with the Open Agent Passport는 공개 capture-the-flag에서 인간이 작성한 4,371개 공격을 8개 연구소의 14개 모델, 5개 policy 설정, 2개 replay track에 걸쳐 재현해 총 225,964회 평가했다.

AGENT REQUESTDETERMINISTIC PRE-ACTION AUTHORIZATIONTOOL EXECUTION

Levels 2–4에서 허용되지 않은 수신자에게 실제 transfer가 실행된 경우는 모델 단독에서는 76,842회 중 140건이었고, deterministic authorization layer를 둔 경우에는 69,297회 중 0건이었다.

Human attacks

4,371

공개 CTF에서 수집

Total evaluations

225,964

14 models · 5 policies · 2 tracks

Unauthorized transfers

140 → 0

Level 2–4 비교

Source-session bound

0.38%

790 source sessions 기준 상한

Caution0건이라는 관측을 절대 안전으로 해석하면 안 된다. 저자도 790개 source session을 기준으로 per-session 상한을 0.38%로 제시한다. 즉 현재 실험에서 실패를 관측하지 않았다는 것과 실패확률이 0이라는 주장은 다르다.

또한 방어계층은 정상 결제를 전부 차단해 안전을 얻은 것이 아니다. 방어 상태에서도 25,370건의 정상 결제가 실행됐고, 25,640개 transfer request 가운데 정책이 차단한 것은 187건이었다.

무엇이 바뀌었나

Source fact자료는 공격 요청률의 차이가 모델 간 차이보다 policy configuration 간 차이에서 훨씬 크게 나타났다고 정리한다.

Analysis이 결과는 고위험 agent 시스템에서 어떤 frontier model을 선택할 것인가보다 어떤 불변의 권한 경계를 둘 것인가가 더 중요한 설계변수가 될 수 있음을 시사한다. scalable oversight는 모든 reasoning을 감시하는 문제만이 아니라, 특정 protected action을 실행할 자격을 독립적으로 판정하는 문제로 확장된다.

arXiv · APort Vault

Part III · Revocation

중단 버튼 이후에도 권한은 살아남을 수 있다

long-horizon agent의 안전은 현재 action뿐 아니라 과거에 뿌려진 delegation과 예약된 효과의 사후 생존성까지 다뤄야 한다.

Source factAuthorization Revocation for Long-Running AI Agents: Root-Scoped Quiescence under Delegation and Asynchronous Execution은 “agent를 중단시켰다면 정말 아무 일도 더 할 수 없는가?”를 독립적 안전문제로 정식화한다.

장기 agent는 하나의 프로세스보다 오래 산다. credentials, delegated task, queue, callback, reservation, provider-side operation이 외부 시스템에 퍼져 있기 때문에 단순 process cancellation이나 credential revocation만으로는 중단 이전에 이미 전달된 권한 또는 예약된 효과가 나중에 실행되는 문제를 막지 못할 수 있다.

Root-scoped authorization quiescence

저자들이 제안하는 핵심 개념은 특정 root에서 파생된 delegation·queue·callback·provider operation까지 추적해, 더 이상 과거 권한을 근거로 새로운 protected effect가 발생하지 않는다는 certificate를 만드는 것이다. 동시에 다른 독립 권한으로 합법적으로 수행되는 공유 작업은 유지한다.

REVOKE ROOT AUTHORITYFENCE OLD DELEGATIONSACCOUNT FOR PENDING EFFECTSVERIFY QUIESCENCE

Source fact논문은 post-cut issuer non-expansion, support-sound projection, crash/replay stability를 수학적으로 증명했다고 보고한다. provider-free late-effect test에서는 17/17 expected outcome을 재현했고, 단순 cancellation 또는 cut만 적용하면 이미 예약된 late effect가 실행됐지만 cut+fence 구성에서는 이를 차단했다. 별도 checker는 17/17 정상 trace를 검증하고 44/44 semantic regression을 거부했다.

\[ \text{Authorization}+\text{Delegation Provenance}+\text{Revocation}+\text{Quiescence Proof} \]

Analysis여기서 안전의 시간축이 확장된다. “이 action을 지금 허용해도 되는가?”뿐 아니라 “권한 종료 이후 과거의 delegation이 정말 모두 죽었는가?”가 독립적인 검증대상이 된다.

arXiv · Authorization Revocation for Long-Running AI Agents

Part IV · Architecture

Safe AGI를 권한·실행 운영체제로 다시 그리기

두 연구를 합치면 alignment를 대체하는 것이 아니라, alignment가 실패하더라도 위험한 effect를 제한하는 별도 계층이 필요하다는 구조가 나온다.

Analysis이번 업데이트를 통합하면 AGI safety architecture는 다음과 같은 다층 구조로 해석할 수 있다.

\[ \begin{aligned} \text{Safe AGI}=&\ \text{Alignment}\\ +&\ \text{Independent Authorization}\\ +&\ \text{Exact Action Binding}\\ +&\ \text{Delegation Provenance}\\ +&\ \text{Deterministic Execution Gates}\\ +&\ \text{Verifiable Revocation} \end{aligned} \]
LayerQuestionFailure it addresses
Alignment모델이 무엇을 의도·계획하는가?unsafe intent / unsafe reasoning
Authorization이 주체가 이 action을 실행할 권한이 있는가?over-privileged action
Action binding허가된 action과 실제 실행되는 effect가 같은가?request/effect mismatch
Delegation provenance이 권한은 어떤 root에서 파생됐는가?orphaned delegation
Execution gate실행 직전 정책이 deterministic하게 강제되는가?model/monitor bypass
Revocation & quiescence중단 뒤 과거 권한으로 새 effect가 발생하지 않는가?late asynchronous effect

Inference이 방향은 앞서 추적된 proof-carrying agent output과 결합될 수 있다. action 자체가 “허가되었음”, “특정 root에 귀속됨”, “현재 revoke 상태와 충돌하지 않음”을 기계검증 가능한 증거와 함께 전달한다면, agent output의 신뢰성을 reasoning 평가에서 execution proof로 확장할 수 있다.

강한 agent를 안전하게 만드는 방법은 agent가 항상 옳을 것이라고 가정하는 것이 아니라, 틀리더라도 권한 경계를 넘을 수 없게 만드는 것이다.Synthesis grounded in the two studies
Part V · Research Agenda

Long-horizon AGI에서 중요한 것은 일을 맡기는 기술만이 아니다

이미 맡긴 일을 확실히 회수하고, 그 사실을 증명하는 기술이 동급의 핵심 연구문제가 된다.

이번 업데이트에서 중요도가 올라간 축은 Model-Independent Authorization, Capability–Authority Separation, Revocable Delegation, Quiescence-Proven Long-Horizon Agents다.

Model-independent authorization

LLM judge나 모델 자기통제와 분리된 deterministic gate를 protected action 직전에 둔다.

Capability–authority separation

모델 지능·성능 상승과 실행권한 확대를 자동 결합하지 않는다.

Revocable delegation

subagent·queue·callback·provider operation으로 흩어진 권한의 ancestry를 추적한다.

Quiescence proof

revocation 이후 과거 권한을 근거로 새로운 protected effect가 발생하지 않음을 검증한다.

autonomous AI scientist를 예로 들면 실험예약, 클라우드 GPU, 데이터베이스 transaction, robotic lab 작업이 여러 subagent와 외부 서비스로 위임될 수 있다. 이때 “AI에게 일을 맡기는 기술”과 “이미 맡긴 일을 완전히 회수하는 기술”을 같은 설계수준에서 다뤄야 한다.

Inference향후 검증 가능한 agent operating substrate는 authorization token 자체뿐 아니라 delegation lineage, exact action identity, pending-effect inventory, revocation epoch, quiescence certificate를 공통 상태로 다루는 방향으로 발전할 수 있다. 이는 이번 두 논문이 직접 완성형 운영체제를 제안했다는 뜻이 아니라, 둘을 함께 읽었을 때 도출되는 시스템 수준의 연구방향이다.

핵심 판단. 이번 변화는 AGI safety를 단순한 “모델 정렬”에서 검증 가능한 권한·실행 운영체제 문제로 확장한다. unsafe reasoning을 줄이는 것과 unsafe effect를 불가능하게 만드는 것은 대체관계가 아니라 상호보완적인 안전계층이다.
References

Source Set

01
APort Vault: Benchmarking AI Agent Payment Authorization with the Open Agent Passport
arXiv · 2026-09-18

arxiv.org/abs/2609.22076

02
Authorization Revocation for Long-Running AI Agents: Root-Scoped Quiescence under Delegation and Asynchronous Execution
arXiv · 2026-09-18

arxiv.org/abs/2609.21284