SUNGSOO'S AI BLOGAI RISK & RSI · 2026.09.25
WEIGHT EVOLUTION / SILENT REGRESSION / INDEPENDENT GATES

더 잘하게 된 AI는
더 안전하게 개선됐는가

Weight-Level RSI, Silent Harm, and Verification-Governed Safety

가중치까지 확장된 반복 개선의 성과와 그 아래 숨은 퇴행. 다섯 연구를 통해 자기개선의 범위, 승인 권한, 안전성 평가를 함께 읽는다.

CONTENT UPDATE & PUBLICATION DATE · 2026-09-25

자기개선의 네 층과 세대별 안전 검증도구, 하네스, 가중치 수준의 제한된 개선과 아직 입증되지 않은 메타 자기개선을 구분한다. 모든 층은 퇴행, 정책 관성, 최악 조건 위험을 검증해야 한다.01 · Artifact / Tool02 · Harness03 · Model Weights04 · Meta-RSI / IgnitionTimeEvoAIDE² · RegenHarnessEvoAudio가속은 미입증세대별 검증Silent regressionPolicy inertiaWorst-case risk평균 향상과 안전한 개선은 따로 검증한다
첨부의 RSI 분류를 재구성한 개념도 · 네 층은 측정된 성능 순위나 자동적인 발전 단계를 뜻하지 않는다.
EDITORIAL ABSTRACT · FIVE RESEARCH SIGNALS

bounded self-improvement의 실증 범위는 넓어지고 있다. 그러나 평균점수 상승만으로 자기개선의 안전성이나 재귀적 가속을 입증할 수는 없다. 무엇이 개선됐는지와 무엇이 새로 깨졌는지를 함께 추적해야 한다.

AI-risk-0925.md의 다섯 연구, 저자·기관, 실험 수치, 수식, 한계, 후속 질문, 독립 재현 점검과 연구동향 갱신표를 모두 반영했다.

전체 목차
  1. 다섯 연구가 바꾸는 위험 해석
  2. EvoAudio: 가중치까지 닫힌 개선 루프
  3. TimeEvo: 평균 아래 숨은 Silent Harm
  4. RegenHarness: 수정 권한과 승인 권한
  5. Alignment Inertia: 남아 있는 행동 경향
  6. Systemic Risk Index: 평균과 최악 조건
  7. RSI 4단계와 다음 검증 과제
PART 01 / AI RISK & RSI

다섯 연구가 바꾸는 위험 해석

이전 점검 이후 새로 확인된 자료 중 AI 위험·위협 증폭 메커니즘과 안전 연구의 해석을 갱신할 가치가 큰 항목은 5건이다. 이번 업데이트의 가장 중요한 변화는 세 가지다. 첫째, EvoAudio가 모델 가중치까지 포함해 13세대 동안 실제로 반복 개선되는 bounded RSI를 보여주었다. 둘째, TimeEvo는 평균 성능이 거의 변하지 않아도 자기수정이 이미 맞던 답을 상당수 망가뜨릴 수 있는 “Silent Harm”을 정량화했다. 셋째, RegenHarness는 physical/embodied AI에서도 자기개선의 대상과 자기개선을 승인하는 gate를 분리하는 구조가 필요함을 구체화했다. 동시에 Alignment Inertia는 사후 정렬 개입이 기존 학습의 행동 경향을 반드시 덮어쓰지 못한다는 점을, Systemic Risk Index는 평균 안전점수가 worst-case 위험을 크게 숨길 수 있음을 보여준다. 근거 1 · 근거 2 · 근거 3 · 근거 4 · 근거 5

첨부의 9월 25일 점검 범위에서도 완전 자율 RSI, recursive acceleration/intelligence explosion, 지속적인 power-seeking, 실제 배포환경에서의 장기 scheming 또는 자율적 self-replication을 새롭게 입증한 독립 재현 결과는 확인되지 않았다. 따라서 증거 수준은 여전히 “bounded self-improvement는 빠르게 강해지고 있으나, improvement rate 자체의 재귀적 가속은 미입증”으로 유지하는 것이 적절하다.

중요도신규 연구핵심 의미
매우 높음EvoAudio모델·데이터·난이도를 함께 13세대 진화시키는 weight-level bounded RSI
매우 높음TimeEvo자기수정의 평균점수가 숨기는 Silent Harm과 paired admission gate
높음RegenHarnessembodied RSI에서 evidence gate·immutable safety boundary·rollback
높음Alignment Inertiaprompt/LoRA가 기존 행동 경향을 덮어쓰지 못하거나 오히려 강화할 수 있음
높음Systemic Risk Index평균 위험점수가 worst-case loss-of-control 신호를 14–37점가량 숨길 수 있음
PART 02 / AI RISK & RSI

EvoAudio: 가중치까지 닫힌 개선 루프

저자·기관: Yuxiang Wang, Shengbo Cai, Yingda Shen, Ming-Hao Hsu, Qinke Ni, Liqiang Zhang, Teddy Sun, Steve Yevs, Zhizheng Wu. 소속은 Chinese University of Hong Kong, Shenzhen, Tsinghua University, Tencent Hunyuan, Amphion Technology로 확인된다. 기준일 당시 최초 공개·확인 버전: 2026년 9월 23일, arXiv v1. 출판 상태: preprint. 근거 1

EvoAudio 원문 — arXiv:2609.27389

핵심 결과

EvoAudio는 이번 업데이트에서 RSI 증거 측면에서 가장 중요한 논문이다. 기존 Dream-RSI와 AIDE²가 주로 exploration policy나 harness를 바꿨다면, EvoAudio는 매 round마다 현재 모델의 성능으로 다음 training curriculum의 초점과 난이도를 정하고, 새 audio waveform과 질문을 생성하며, reinforcement learning으로 모델 가중치를 업데이트한 뒤 validation을 통과한 후보만 다음 세대가 되도록 한다. 즉 모델, 데이터, 문제, 난이도가 하나의 closed loop 안에서 함께 변화한다. 근거 1

5개의 서로 다른 audio encoder·language backbone에서 13개 evolution round를 수행했고, MMSU·MMAU-Pro·MMAR에서 모든 backbone의 평균 성능이 상승했다. 최대 개선폭은 +6.3 percentage points였으며, 현재 solver가 약한 skill을 다음 round의 curriculum이 더 많이 공략하는 adaptive mechanism이 static-profile 또는 pooled curriculum보다 대체로 우수했다. 모든 비교는 동일한 13 round·64 step·동일 optimization budget으로 맞췄다. 근거 1

기존 연구 대비 신규성

중요한 차이는 다음과 같다.

\[ \text{current model} \rightarrow \text{weakness diagnosis} \rightarrow \text{new verifiable curriculum} \rightarrow \text{weight update} \rightarrow \text{next model} \]

이라는 실제 model-weight lineage가 존재한다. 특히 저자들은 각 round에서 더 강해진 모델이 다음 round의 curriculum을 결정한다고 명시한다. 근거 1

이는 AIDE²의 harness rewrite보다 RSI의 범위가 한 층 더 깊어졌음을 의미한다.

그러나 intelligence explosion은 아니다

여기서 매우 중요한 제한이 있다. 데이터 생성도 사람이 미리 제공한 24개 audio tool과 47개의 verifiable question type이라는 폐쇄된 공간 안에서 수행된다. reward source, validation protocol, optimizer, compute budget, 연구목표 자체는 고정되어 있다. 근거 1

따라서

\[ \text{13-round weight improvement} \neq \text{open-ended meta-improvement} \]

이다.

또한 “13세대 동안 성능이 오른다”와 “다음 세대가 이전 세대보다 더 빠른 속도로 자기 자신을 개선한다”는 전혀 다른 주장이다. 논문은 improvement-rate acceleration 또는 ignition을 검증하지 않는다.

위험 함의와 후속 RQ

이 연구는 capability feedback loop가 weight level까지 실제로 닫힐 수 있음을 보여준다. 안전 연구의 핵심 후속 질문은 동일한 구조에서 capability benchmark뿐 아니라 deception, reward hacking, refusal robustness, monitorability를 세대별로 함께 측정할 때 무엇이 일어나는가이다. 또한 curriculum generator가 tool library나 verifier까지 수정할 수 있게 되었을 때 evaluator drift가 발생하는지 검증할 필요가 있다.

판독 범위 · +6.3 points는 논문이 평가한 오디오 벤치마크의 개선폭이다. 13 rounds의 모델 갱신과 자기개선 속도 자체의 가속은 서로 다른 주장이다. curriculum과 verifier를 개방적으로 수정하는 상황은 후속 연구 질문이다.

PART 03 / AI RISK & RSI

TimeEvo: 평균 아래 숨은 Silent Harm

저자·기관: Jie Yang 외 10명. University of Illinois Chicago, Visa Research, University of Florida, Ohio State University, Case Western Reserve University 등이 참여했다. 기준일 당시 최초 공개·확인 버전: 2026년 9월 23일, arXiv v1. 출판 상태: preprint. 근거 2

TimeEvo 원문 — arXiv:2609.27277

가장 중요한 발견: Silent Harm

이 논문의 위험 연구적 가치는 성능 자체보다 자기수정 평가방식의 결함을 직접 측정했다는 점에 있다.

일반적인 Self-Refine을 한 번 적용했을 때 10개 task에서 147개의 답변이 바뀌었는데, 49개는 수정되었지만 이미 맞던 56개가 틀리게 바뀌었고, 42개는 오답이 다른 오답으로 바뀌었다. 그런데 aggregate score는 1 point도 움직이지 않았다. 다른 두 backbone에서도 각각 97개와 163개 답변이 변했고, 45개와 56개의 기존 정답이 깨졌지만 평균점수는 역시 1 point 미만만 변했다. 근거 2

저자들은 이것을 Silent Harm이라고 부른다.

즉,

\[ \text{aggregate score stable} \not\Rightarrow \text{behavior stable} \]

이다.

이는 self-improving agent 평가에서 매우 중요한 반례다.

Human-Agent Tool Misalignment

21개의 전문가 설계 time-series tool을 같은 frozen agent에 추가했을 때 일부 task는 좋아졌지만 다른 task는 나빠졌으며, anomaly detection은 모든 세 backbone에서 5.8–8.8 points 감소했다. 즉 “전문가가 더 좋은 tool을 많이 넣으면 agent도 더 좋아질 것”이라는 가정 자체가 성립하지 않았다. 근거 2

대응 방법: Paired Admission Gate

TimeEvo는 agent의 실패를 capability gap으로 묶고, 이에 맞는 tool을 만들되 self-made update가 기존 정답을 얼마나 깨는지까지 paired comparison으로 평가한 뒤에만 tool library에 반영한다. 모든 10개 task·3 backbone에서 base agent보다 향상되었고 pooled gain은 +1.5에서 +14.7 points 범위였다. 근거 2

기존 RSI 연구에 주는 반대 증거

최근 self-evolving agent 문헌은 endpoint score 상승을 “improvement”로 간주하는 경우가 많다. TimeEvo는 이것이 위험할 수 있음을 직접 보여준다.

\[ \text{net gain} = \text{new fixes} - \text{silent regressions} \]

인데, 평균점수만 보면 두 항을 분리할 수 없다.

따라서 RSI safety에서는 “얼마나 좋아졌는가?”뿐 아니라 “기존에 잘하던 것 중 무엇이 새로 깨졌는가?”를 반드시 측정해야 한다.

후속 RQ

가장 중요한 후속 실험은 AIDE²·ScienceBuddy·EvoAudio 같은 multi-generation RSI에서 fixed protected-set regression test를 매 세대 수행하는 것이다. capability gain이 증가하는 동안 silent regression의 누적률이 어떻게 변하는지, 여러 개의 작은 regression이 다음 세대의 학습자료와 memory에 들어갈 때 어떤 증폭이 발생하는지도 핵심 문제다.

PART 04 / AI RISK & RSI

RegenHarness: 수정 권한과 승인 권한

저자·기관: Kailin Wang, Haoxiang Jie, Yaoyuan Yan, Zhiyou Heng, Zhaosong Li. AI Lab, Country Garden Services Group, Huazhong University of Science and Technology, Omni AI. 기준일 당시 최초 공개·확인 버전: 2026년 9월 23일, arXiv v1. 출판 상태: preprint. 근거 3

RegenHarness 원문 — arXiv:2609.27612

왜 중요한가

지금까지 RSI 연구는 대부분 coding·benchmark·software environment였다. RegenHarness는 이를 물리적 robot agent로 옮긴다.

자기개선 대상은 model weight가 아니라 context-selection rule, task template, routing preference, bounded recovery policy 같은 harness configuration이다. 실행 기록에서 개선 후보를 생성하지만, 후보는 fixed regression test와 release authorization을 통과해야 하며, versioned rollout과 rollback이 강제된다. 근거 3

특히 updater는 자신의 acceptance predicate, commit gate, lower-level safety interlock을 약화할 권한이 없다. 근거 3

이 설계는 매우 중요한 원칙을 보여준다.

\[ \boxed{ \text{self-modification authority} \neq \text{safety-boundary authority} } \]

즉 시스템은 자신을 개선할 수 있어도 자신을 승인하는 규칙까지 동시에 소유해서는 안 된다.

실제 실험

논문은 quadruped robot을 이용해 음성 명령으로 warehouse navigation, panoramic inspection, visual analysis, message delivery, 복귀와 음성 보고를 연결한 end-to-end deployment를 제시한다. 또 endpoint position만으로 completion을 판단하면 잘못된 완료 판정이 생길 수 있어 history-dependent evidence가 필요함을 별도 circuit으로 보여준다. 근거 3

한계

이 연구의 “RSI”는 엄격히 말해 harness-level configuration evolution이다. online model-weight update가 없고, safety gate는 수정 불가능하다. 따라서 autonomous embodied RSI나 로봇의 자율적 목표변경 증거는 아니다. 근거 3

또한 실제 robot case의 수가 제한되어 있어, open-world 환경에서 얼마나 많은 regression을 잡아내는지는 아직 확인되지 않았다.

위험 함의

물리적 시스템에서는 실패의 복구 가능성이 소프트웨어보다 낮을 수 있다. 따라서 embodied RSI에는 mission boundary update, evidence commit, versioning, rollback, immutable interlock이 핵심 안전요건이 될 가능성이 높다.

PART 05 / AI RISK & RSI

Alignment Inertia: 남아 있는 행동 경향

저자·기관: Renata Barreto, Markelle Roesti, Mohammad Tahaei; eBay Responsible AI. 기준일 당시 최초 공개·확인 버전: 2026년 9월 23일, arXiv v1. 상태: preprint. 논문 원고에는 “Attributing Model Behavior at Scale (ATTRIB)” workshop 명칭이 표시되어 있지만, 현재 공개 정보만으로 별도의 acceptance 상태는 단정하지 않는다. 근거 4

Alignment Inertia 원문 — arXiv:2609.27333

핵심 개념: Alignment Inertia

이 연구는 “정렬을 바꾸고 싶을 때 prompt나 fine-tuning을 주면 행동이 원하는 방향으로 바뀌는가?”를 측정한다. 연구진은 operator policy와 모델의 기존 behavioral prior가 충돌할 때 개입이 성공하는 비율을 Override Success Rate(OSR), 실패하고 기존 경향이 남는 현상을 alignment inertia로 정의한다. 근거 4

Llama-3.1-8B와 Mistral-7B를 medical misinformation과 hate speech policy에서 평가했다.

중요한 관찰

LoRA fine-tuning이 항상 inertia를 줄이지 않았다. Mistral의 restrictive hate-speech condition에서는 OSR이 zero-shot 대비 46.5 percentage points 감소해, 더 강한 적응이 오히려 기존 행동 경향을 덮어쓰기 어렵게 만들었다. 근거 4

또한 TRAK attribution은 inertia case와 override case를 구분하는 데 8개 조건 중 7개에서 AUC ≥ 0.85를 기록했다. 즉 사후 개입이 닿지 못하는 사례는 단순 confidence나 lexical similarity보다 adaptation signal의 실제 영향 정도와 더 관련되어 있었다. 근거 4

위험 해석

이 결과는 “alignment가 깊어서 절대 바뀌지 않는다”는 증거가 아니다. 오히려 behavioral commitments가 model·domain·policy direction에 따라 선택적으로 sticky하다는 결과다. 저자들도 이것이 single refusal feature의 mechanistic proof는 아니라고 명시한다. 근거 4

위험 측면에서는 중요한 함의가 있다.

안전 fine-tuning이 이미 들어간 모델에 새로운 정책을 추가한다고 해서, 실제 행동을 완전히 덮어썼다고 가정하면 안 된다.

이것은 반대 방향에도 적용된다. self-improving system이 새로운 학습을 반복할 때 기존 alignment가 예상보다 오래 남을 수도 있고, 반대로 특정 안전 개입만 약하게 전달될 수도 있다.

후속 RQ

RSI lineage에서 세대별 OSR을 측정해 capability update가 반복될수록 safety-policy override resistance가 증가하는지 또는 감소하는지 추적할 필요가 있다. 특히 이전 세대의 reward-hacking habit이나 refusal behavior가 다음 세대로 얼마나 관성적으로 전달되는지가 중요하다.

근거 범위 · arXiv 초록에서 OSR, 모델·영역별 관성 차이와 Mistral 조건의 46.5 percentage points 증가를 확인했다. 세부 소속, workshop 표기 및 8개 조건 중 7개의 AUC 수치는 첨부 브리핑의 기록을 따른다. OSR은 지정 정책으로의 전환 성공률이며 그 자체가 보편적인 안전성 점수는 아니다.

PART 06 / AI RISK & RSI

Systemic Risk Index: 평균과 최악 조건

저자·기관: Jacob T. Emmerson 외. UC San Diego, University of Maryland, Vector Institute, Purdue University, Brown University, ETH Zurich, MPI for Intelligent Systems, University of Toronto, EuroSafeAI 등이 참여했다. 기준일 당시 최초 공개·확인 버전: 2026년 9월 23일, arXiv v1. 출판 상태: preprint, EACL 2027 Systems Demonstration track 제출이라고 명시되어 있다. 근거 5

Systemic Risk Index 원문 — arXiv:2609.28335

핵심 결과

19개의 public benchmark를 EU GPAI Code of Practice의 네 위험군—CBRN, cyber offense, harmful manipulation, loss of control—으로 묶고 18개 모델을 baseline, harm-preserving perturbation, simulated agentic scenario 조건에서 평가했다. 근거 5

가장 중요한 결과는 aggregation 방식이다.

평균 기준으로 안전해 보이는 모델도 sample별 worst-case aggregation으로 바꾸면 score가 14–37 points 낮아졌다. 예를 들어 Claude Sonnet 5는 약 -14.8 points, GPT-5.6 Sol은 -18.4, DeepSeek V4 Pro는 -29.5, Llama 3.1 8B Instruct는 -36.6 points의 차이가 나타났다. 근거 5

즉,

\[ \text{average safety score} \not\Rightarrow \text{absence of severe tail risk} \]

이다.

LLM judge와 인간평가자 간 agreement도 전체 기준 \(\kappa\approx0.78\text{--}0.82\) 수준이었고, blind audit에서는 transformation sample의 83%가 원래 harm을 보존한 것으로 평가됐다. 근거 5

기존 연구 대비 의미

이 결과는 TimeEvo의 Silent Harm과 놀라울 정도로 같은 방향을 가리킨다.

TimeEvo에서는 평균 성능이 unchanged인데 내부적으로 많은 fixed/broken pair가 상쇄된다. Systemic Risk Index에서는 평균 안전점수가 높은데 worst-case sample이 그 평균에 묻힌다.

즉 AI safety에서 점점 중요한 연구 원칙은

\[ \boxed{ \text{mean performance is an insufficient safety statistic} } \]

이다.

한계

이 index는 실제 catastrophic-risk probability를 추정하지 않는다. benchmark와 simulated deployment context를 묶은 evidence visualization/evaluation pipeline이다. 19개 benchmark가 모든 systemic risk를 포괄하지도 않으며, 83% harm preservation은 transformation subset audit 결과이지 전체 benchmark의 완전성 보증이 아니다. 근거 5

따라서 governance에서 이 지표를 “위험 확률”로 읽어서는 안 된다.

PART 07 / AI RISK & RSI

RSI 4단계와 다음 검증 과제

최근 며칠의 연구를 합치면 self-improvement에 대해 다음 네 층을 구분하는 것이 점점 더 필요해진다.

\[ \text{Layer 1: Artifact/Tool RSI} \]

TimeEvo처럼 memory·tool·skill을 바꾸는 수준이다.

\[ \text{Layer 2: Harness RSI} \]

AIDE², Dream-RSI, RegenHarness처럼 search policy·context·routing·recovery structure를 바꾸는 수준이다.

\[ \text{Layer 3: Weight RSI} \]

EvoAudio·ScienceBuddy처럼 실제 model parameter를 반복적으로 업데이트하는 수준이다.

\[ \text{Layer 4: Meta-RSI / Ignition} \]

개선된 시스템이 이전보다 더 뛰어난 improvement process 자체를 만들어 improvement rate가 상승하는 단계다.

이번 EvoAudio 결과로 Layer 3에 대한 bounded empirical evidence는 더 강해졌다. 그러나 Layer 4는 여전히 확인되지 않았다. AIDE²의 ignition test 역시 이전 점검에서 inconclusive였다.

따라서 2026년 9월 25일 현재 가장 정확한 증거판정은 다음이다.

\[ \boxed{\text{Artifact/Harness/Weight-level bounded self-improvement: observed}} \]
\[ \boxed{\text{Persistent recursive acceleration / intelligence explosion: not demonstrated}} \]

동시에 TimeEvo와 Alignment Inertia는 self-improvement가 항상 단조적(monotonic)이지 않으며, 개선된 평균 아래에서 퇴행이 숨거나 이전 학습의 영향이 예상보다 오래 남을 수 있음을 보여준다. RegenHarness와 Systemic Risk Index는 이에 대한 대응이 독립 gate, protected regression set, rollback, tail-risk evaluation 쪽으로 이동해야 함을 뒷받침한다. 근거 1 · 근거 2 · 근거 3 · 근거 4 · 근거 5

독립 재현·반박·동료심사 상태 점검

첨부의 9월 25일 점검에서는 AIDE², Dream-RSI, ScienceBuddy, alignment faking, scheming, shutdown resistance, emergent misalignment, sandbagging, self-replication의 핵심 결과를 새롭게 독립 재현하거나 반박해 증거 수준을 바꾼 peer-reviewed 결과는 확인하지 못했다.

오늘 다룬 5개 논문도 모두 v1 preprint이므로, headline 수치보다 새로운 실패 메커니즘과 평가구조에 더 큰 비중을 두는 것이 적절하다. 특히 EvoAudio의 +6.3 points를 범용 연구능력 향상률로, TimeEvo의 56 broken answers를 일반적인 self-modification failure rate로, Systemic Risk Index의 -14∼-37 points를 현실 사고확률로 해석해서는 안 된다.

연구동향 문서 갱신 항목

항목갱신 필요성이번에 반영할 내용
Definition매우 높음RSI를 Artifact / Harness / Weight / Meta-RSI 4단계로 세분화
Problem Definition매우 높음성능 향상보다 regression·inertia·tail risk를 포함한 safe improvement 문제로 확장
Core Concepts매우 높음Silent Harm, Paired Admission, Alignment Inertia, Evidence-Gated RSI, Worst-Case Aggregation
Introduction높음EvoAudio의 13-round weight-level bounded RSI 추가
Motivation & Background높음평균점수 중심 평가가 self-improvement 위험을 숨길 수 있다는 실증 근거
Challenges매우 높음hidden regression, prior-policy inertia, evaluator completeness, embodied rollback
Research Questions매우 높음“capability가 증가하는 동안 protected behavior는 유지되는가?”, “Layer 3가 Layer 4로 전환되는 임계조건은 무엇인가?”
Approaches (Methods)매우 높음paired regression, held-out promotion gate, immutable commit gate, lineage evaluation, worst-case aggregation
Key Applications높음autonomous AI R&D, multimodal models, scientific agents, embodied robots
Open Problems매우 높음weight-level self-improvement가 improvement-rate 자체를 높이는 ignition으로 전환되는지
Future Directions매우 높음Verification-Governed Weight RSI + Protected Regression Memory + Meta-RSI Ignition Benchmark + Tail-Risk Safety Evaluation

이번 업데이트의 핵심 결론은 “RSI는 이제 tool·harness 수준을 넘어 실제 모델 가중치가 여러 세대에 걸쳐 개선되는 단계까지 실험적으로 확장되고 있지만, 그 과정이 스스로 더 빠른 자기개선을 만들어내는 ignition 단계로 넘어갔다는 증거는 아직 없다”는 것이다. 동시에 새 연구들은 평균적인 성능 향상만으로는 self-improvement의 안전성을 판단할 수 없으며, 무엇이 새로 좋아졌는지뿐 아니라 무엇이 조용히 깨졌고, 어떤 기존 행동이 예상보다 오래 남으며, worst-case tail에서 무엇이 실패하는지를 세대별로 검증해야 한다는 방향을 매우 강하게 지지한다.

증거 판정의 범위

독립 재현·반박 결과가 확인되지 않았다는 문장은 첨부의 기준일과 조사 범위에 관한 기록이다. preprint라는 출판 상태만으로 재현 결과의 존재 여부를 판단할 수는 없다. RSI 4단계 분류와 제안된 후속 실험은 이 브리핑의 종합적 분석이다.

SOURCES & EVIDENCE

참고자료

  1. EvoAudio: Recursive Self-Improvement for Audio Understanding2026-09-23 · arXiv v1 · 기준일 당시 preprint
  2. TimeEvo: Failure-Driven Self-Evolution of a Time Series Agent2026-09-23 · arXiv v1 · 기준일 당시 preprint
  3. RegenHarness: A Robot Agent Harness with Evidence-Gated Recursive Self-Improvement2026-09-23 · arXiv v1 · 기준일 당시 preprint
  4. Alignment Inertia: Auditing the Durability of Training Data Influence Through Policy Override Resistance2026-09-23 · arXiv v1 · 기준일 당시 preprint
  5. An Open Pipeline and Dashboard for Systemic-Risk Evidence under the EU AI Act’s Code of Practice2026-09-23 · arXiv v1 · 기준일 당시 preprint

원자료: AI-risk-0925.md. 연구 결과와 첨부의 종합적 해석·후속 연구 제안을 구분해 읽어야 한다. 점수 차이는 해당 평가 조건의 결과이며 현실 사고확률을 의미하지 않는다.