AI Research NotesMeta-Learning × AGI2025–2026 Research Landscape
Research Landscape2025–2026Meta-LearningAGI

새로운 문제를 푸는 AI에서
스스로 배우는 법을 바꾸는 AI로

Meta-Learning for AGI: From Fast Adaptation to Self-Improving Agents

Meta-Learning for AGI adaptive intelligence loop Novel environment에서 observation, uncertainty, meta-controller, adaptation, experience, memory를 거쳐 다시 reasoning으로 돌아오는 개념적 폐쇄루프 NOVEL환경·과제 META무엇을 바꿀까? ADAPT학습·행동 EXPERIENCE기억·수정 REASON → EXPERIENCE → LEARN → REVISE → REASON BETTER
Central thesis

2025년 이후 Meta-Learning의 전선은 “몇 개의 예제로 새 과제를 빨리 푼다”는 문제에서 벗어나고 있다. 새로운 환경에서 무엇을 배워야 하는지 판단하고, 어떻게 탐색하고, 자신의 어느 부분을 수정하며, 그 개선을 다음 과제로 어떻게 축적할 것인가가 핵심 문제가 되었다.

이 변화는 단순한 용어 확장이 아니다. In-context learning, test-time learning, meta-RL, continual learning, memory adaptation, self-improving agents, ARC-AGI의 refinement loop가 하나의 연구축으로 수렴하고 있다. 이 글은 2025년 이후의 대표 연구를 바탕으로 Definition → Problem Definition → Core Concepts → Challenges → Research Questions → Approaches → Open Problems → Future Directions 순으로 그 지형을 재구성한다.

\[ \text{Meta-Learning for AGI}\;\approx\;\text{learning how to adapt the learner itself from experience} \]
Part I · Definition & Problem

학습의 대상이 모델에서 “학습 시스템 전체”로 확장된다

전통적 Meta-Learning의 수학적 구조를 유지하되, AGI 시대에는 업데이트 가능한 상태공간 자체가 넓어진다.

§1 · Definition

Meta-Learning은 무엇을 학습하는가

전통적인 Meta-Learning은 여러 task에서 얻은 transferable knowledge를 이용하여 새로운 task에 적은 데이터로 빠르게 적응하는 학습 패러다임이다. Task \(\mathcal T\sim p(\mathcal T)\)가 주어졌을 때, meta-learner는 새로운 task의 데이터 \(D_{\mathcal T}\)를 받아 learner를 어떻게 갱신할지 학습한다.

\[ \phi^*=\arg\min_{\phi}\;\mathbb E_{\mathcal T}\left[L_{\mathcal T}\left(U_{\phi}(\theta,D_{\mathcal T})\right)\right] \]

여기서 \(\theta\)는 현재 모델, \(U_\phi\)는 적응 연산자, \(\phi\)는 “어떻게 학습할 것인가”를 결정하는 meta-knowledge이다. 2026년 Hoppmann과 Scholz의 survey는 이 계보를 meta-RL과 generalist adaptive agent까지 연결한다.

그러나 Foundation Model과 Agent 시대에는 가중치만 바뀌는 것이 학습이 아니다. 현대 Agent를 다음과 같이 볼 수 있다.

\[ A=(\theta,M,P,\Pi,\mathcal K,\mathcal U,C) \]
  • \(\theta\): model parameters
  • \(M\): episodic·semantic memory
  • \(P\): prompts와 instructions
  • \(\Pi\): policy와 planner
  • \(\mathcal K\): knowledge/world model
  • \(\mathcal U\): tool repertoire와 tool-selection policy
  • \(C\): agent control logic와 scaffold

따라서 현대적 Meta-Learning은 경험 \(E_t\)와 feedback \(F_t\)를 받아 다음 Agent 상태를 만드는 연산으로 해석할 수 있다.

\[ A_{t+1}=\mathcal M_{\phi}(A_t,E_t,F_t) \]

2026년 self-improving agent survey도 foundation model과 prompt, memory, tools, control logic의 결합을 하나의 adaptive system으로 보고, self-improvement를 model parameter 또는 scaffold를 갱신하는 self-induced update operator로 정식화한다.

§2 · Problem Definition

AGI의 Meta-Learning은 “새 task를 빨리 푼다”보다 넓다

AGI 관점의 문제는 낯선 task나 environment \(\mathcal T\), 제한된 경험 \(E\), 계산·시간 budget \(B\) 아래에서 미래 성능을 빠르게 높이면서 기존 능력을 보존하고, 학습된 전략을 이후 task로 전이하는 adaptation strategy \(U\)를 찾는 것이다.

\[ \max_U\;\Big(\text{Novel-task performance}+\text{Learning speed}+\text{Transfer}+\text{Retention}\Big) -\Big(\text{Compute}+\text{Forgetting}+\text{Unsafe adaptation}\Big) \]

여기에 AGI 특유의 세 조건이 추가된다. 첫째, task 자체가 미리 정의되지 않을 수 있다. 둘째, 무엇을 업데이트할지도 시스템이 선택해야 한다. 셋째, 단기 적응이 장기적인 intelligence improvement로 누적되어야 한다.

Task inference

문제 설명이 없는 환경에서도 observation과 interaction으로 규칙·목표·dynamics를 추론해야 한다.

Update routing

Weights, context, memory, prompt, planner, tool, agent code 중 어느 상태를 바꿀지 결정해야 한다.

Capability accumulation

한 번의 task 성능 향상이 아니라, 배운 결과가 이후 task의 학습 속도를 높여야 한다.

Part II · Core Concepts

Meta-Learning은 일곱 층의 적응 지능으로 재구성된다

In-context adaptation에서 meta-cognitive control까지, 2025–2026 연구는 하나의 계층적 구조를 드러낸다.

§3 · Seven layers

Fast adaptation에서 self-improvement까지

Layer핵심 질문주요 연구축AGI에서의 의미
L1 · In-Context Meta-Learning가중치를 바꾸지 않고 context만으로 새 규칙을 배울 수 있는가?ICL, Bayesian/meta-learning theory즉시 task identification과 latent rule adaptation
L2 · Test-Time Learning실제 test experience로 모델을 바꿀 수 있는가?TTL, TTA, LoRA adaptationInference와 learning의 경계 붕괴
L3 · Meta-RL상호작용을 통해 새 환경의 policy를 빠르게 적응할 수 있는가?Meta-RL, adaptive agents행동 자체를 정보 획득 수단으로 사용
L4 · Search–Learn Loop실패와 search trace를 다음 학습에 재사용할 수 있는가?SOAR, refinement loops추론을 반복적 adaptation 과정으로 전환
L5 · Continual Meta-Learning여러 task의 경험을 장기적으로 축적할 수 있는가?Continual/Lifelong Learning배울수록 다음 학습이 빨라지는 구조
L6 · Agent Meta-LearningMemory, tool, planner, scaffold 자체를 개선할 수 있는가?Gödel Agent, DGM, self-improving agentsAgent architecture까지 adaptation space로 확장
L7 · Meta-Cognitive Meta-Learning무엇을 모르고 무엇을 바꿔야 하는지 판단할 수 있는가?Uncertainty, reflection, adaptive control학습 전략 선택을 상위 executive control로 통합

이 표는 여러 연구축을 통합한 분석적 분류이다. 하나의 논문이 일곱 층 전체를 입증하는 것은 아니다.

§4 · The key shift

핵심 질문은 “How to update?”에서 “What to change?”로 이동한다

전통 Meta-Learning이 주로 어떻게 weight를 업데이트할 것인가를 물었다면, 현대 Agentic Meta-Learning은 무엇을, 언제, 왜, 어떤 방식으로 바꿀 것인가를 묻는다.

\[ \text{Traditional: Learn how to update weights} \qquad\Longrightarrow\qquad \text{Modern: Learn what to update, when, why, and how} \]

Agent 상태 \(S=\{\theta,M,P,K,T,C\}\)가 있을 때 meta-controller는 현재 experience와 uncertainty를 바탕으로 reasoning을 더 할지, retrieval을 할지, 실험할지, memory를 갱신할지, fine-tune할지, tool이나 planner를 바꿀지 선택해야 한다.

현재의 실패를 해결하기 위해 무엇을 바꾸는 것이 가장 가치 있는가? — 이 질문이 Meta-Learning × AGI의 중심 연구문제로 부상한다.
Part III · 2025–2026 Frontier

추론, 학습, 탐색, 자기수정이 하나의 폐쇄루프로 합쳐진다

SEAL, SOAR, TLM, Gödel Agent, Darwin Gödel Machine, ARC-AGI-3는 서로 다른 수준에서 같은 질문을 다룬다: 경험으로부터 시스템은 어떻게 달라질 수 있는가.

§5 · In-context meta-learning

Context는 단순 입력이 아니라 임시 학습 공간이 된다

In-context learning에서는 test 시점에 parameter를 바꾸지 않더라도 demonstrations를 통해 새로운 task에 적응한다. 2025년 Wakayama와 Suzuki는 ICL을 meta-learning framework에서 분석하고, Transformer가 pretraining 중 meta-algorithm을 획득한 뒤 context를 통해 true task의 최적 알고리즘에 빠르게 접근하는 이론적 관점을 제시했다. Braccaioli 등은 여러 작고 domain-specific한 dataset을 이용한 meta-training으로 unseen domain의 in-context generalization을 개선하는 방향을 연구했다.

\[ \theta_{\text{test}}=\theta_{\text{train}},\qquad f_{\theta}(x\mid\text{context})\;\text{adapts to a new task} \]

이 관점의 핵심은 ICL을 prompt trick이 아니라 latent task identification과 fast adaptation으로 보는 데 있다.

§6 · Test-time learning

Deployment 이후에도 학습은 끝나지 않는다

ICML 2025의 Test-Time Learning for Large Language Models는 unlabeled test data를 이용해 LLM을 test 시점에 동적으로 적응시키는 TLM을 제안한다. 입력 perplexity를 self-supervised signal로 활용하고, 높은 perplexity sample을 선택하며, LoRA로 forgetting을 완화한다. 논문은 AdaptEval에서 original LLM 대비 domain knowledge adaptation 성능이 최소 20% 향상되었다고 보고한다.

또 다른 2025년 연구는 test-time learning ability 자체를 intelligence 평가 대상으로 제안했다. 인간과 비교한 semantic game 실험에서 LLM도 경험을 통해 개선되었지만, cumulative experience에서 개선이 덜 안정적이고 인간보다 느렸다. 이는 static benchmark 점수와 실제 learning ability가 같은 개념이 아님을 보여준다.

§7 · Self-generated adaptation

SEAL — 모델이 자신의 학습 데이터를 만든다

01 · New input새 지식·새 예제·새 task를 만난다
02 · Self-edit모델이 자체 finetuning data와 update directive를 생성한다정보 재구성, augmentation, optimization directive, tool invocation
03 · Weight updateSFT/gradient update를 통해 지속적 변화를 만든다
04 · Meta-reward업데이트된 모델의 downstream performance로 self-edit 품질을 학습한다

NeurIPS 2025의 SEAL(Self-Adapting Language Models)은 모델이 자신의 학습 경험을 만드는 쪽으로 Meta-Learning을 확장한다. 중요한 변화는 답을 생성하는 모델이 아니라, 자신에게 어떤 학습 경험을 주어야 더 좋아지는지 생성하는 모델이라는 점이다.

§8 · Search–learn loop

SOAR — Search의 흔적이 다음 Search를 가르친다

ICML 2025의 SOAR는 evolutionary search와 hindsight learning을 번갈아 수행한다. LLM이 후보 program을 생성·수정하고, search trace에서 valid problem–solution pair를 만들어 다시 fine-tune한다. 이렇게 개선된 모델이 다음 search를 수행한다.

\[ \text{Search}\rightarrow\text{Experience}\rightarrow\text{Hindsight Learning}\rightarrow\text{Better Search} \]

SOAR는 ARC-AGI public test set의 52%를 해결했다고 보고한다. 여기서 중요한 것은 단일 attempt의 정답률보다 search 중 얻은 경험이 다음 iteration의 생성·수정 능력으로 환류된다는 구조이다.

§9 · Refinement as learning

ARC Prize 2025 — reasoning은 반복적 adaptation process가 된다

ARC Prize 2025 Technical Report는 2025년의 defining theme로 refinement loop를 지목한다. Candidate를 만들고, feedback으로 평가하고, 이를 다시 수정하는 per-task iterative optimization이 상위 접근들의 공통 패턴으로 나타났다는 것이다.

\[ x\rightarrow h_1\rightarrow\operatorname{evaluate}\rightarrow h_2\rightarrow\operatorname{evaluate}\rightarrow\cdots\rightarrow y \]

한 번의 forward pass가 아니라 시도–평가–수정의 구조가 reasoning의 일부가 된다. 이것은 test-time search와 meta-learning의 경계를 흐린다.

§10 · Interactive intelligence

ARC-AGI-3 — 정적 추론에서 상호작용적 skill acquisition으로

2026년 ARC-AGI-3는 instruction 없이 novel, abstract, turn-based environment를 탐색하게 한다. Agent는 exploration, goal inference, environment dynamics의 internal model 형성, planning과 action sequence 실행을 수행해야 한다. Technical report는 human test-taker가 모든 environment를 해결한 반면 2026년 3월 당시 frontier AI는 1% 미만의 점수를 기록했다고 보고한다.

Explore정보를 얻기 위한 행동을 선택한다
Model환경 dynamics와 latent rule을 추론한다
Goal무엇을 달성해야 하는지 스스로 찾는다
Plan & Act행동 후 observation으로 world model과 policy를 수정한다

여기서 AGI 평가는 “정답을 아는가”가 아니라 처음 보는 세계에서 얼마나 효율적으로 배워 행동을 바꾸는가로 이동한다.

§10A · Meta-RL

행동은 보상만 얻는 수단이 아니라 “환경을 배우는 실험”이 된다

Meta-Reinforcement Learning에서 Agent는 단순히 어떤 행동이 높은 reward를 주는지 학습하는 데 그치지 않는다. Interaction history를 바탕으로 현재 환경이 어떤 task인지 추론하고, 새 환경에 더 빨리 적응하기 위한 learning policy를 학습한다.

\[ \phi^*=\arg\max_{\phi}\;\mathbb E_{\mathcal T}\left[R_{\mathcal T}\left(U_{\phi}(H)\right)\right] \]

여기서 \(H\)는 observation, action, reward가 누적된 interaction history이다. AGI 관점에서 중요한 질문은 “어떤 행동이 당장 좋은가?”보다 “이 환경을 더 빨리 이해하려면 무엇을 시도해야 하는가?”이다. 즉 exploitation과 exploration 사이의 문제를 넘어, exploration 자체를 학습하는 learning-to-explore 문제가 된다.

2026년 Hierarchical Meta-Reinforcement Learning은 task representation, task-agnostic macro-action, primitive action의 세 계층을 두어 복잡한 multi-task 환경의 빠른 적응을 다룬다. 이 연구가 AGI 자체를 입증하는 것은 아니지만, task 추론과 reusable temporal abstraction을 결합하려는 방향은 generalist adaptive agent에 중요한 설계 단서를 제공한다.

§11 · Agent-level self-improvement

Gödel Agent와 Darwin Gödel Machine — 업데이트 공간이 code와 scaffold까지 넓어진다

ACL 2025의 Gödel Agent는 LLM이 high-level objective 아래 자신의 agent logic과 behavior를 동적으로 수정하도록 한다. Human-designed fixed pipeline이나 predefined meta-learning framework를 넘어 agent design space 자체를 탐색하려는 접근이다.

Darwin Gödel Machine(DGM)은 더 나아가 coding agent의 code를 반복적으로 수정하고 benchmark로 경험적으로 검증한다. 하나의 개선 경로만 좇지 않고 여러 agent의 archive를 유지하면서 open-ended search를 수행한다. 논문은 SWE-bench에서 20.0%→50.0%, Polyglot에서 14.2%→30.7%로 coding performance가 향상되었다고 보고한다.

Self-improvement는 AGI의 증거와 동의어가 아니다. 특정 benchmark에서 code를 개선했다는 결과는 agent-level adaptation 가능성을 보여주지만, 새로운 task distribution 전반의 일반지능을 입증하지는 않는다.Epistemic boundary
§12 · Continual & meta-cognitive learning

빠르게 배우는 것과 오래 배우는 것은 다른 문제다

Meta-Learning이 “어떻게 빨리 배울 것인가”를 다룬다면 continual learning은 “새로운 것을 배우면서 어떻게 과거 능력을 유지할 것인가”를 다룬다. 2025년 ACM Computing Surveys의 두 survey는 foundation/large language model의 continual pretraining, adaptation, fine-tuning과 catastrophic forgetting을 체계화한다. 2026년 IEEE TPAMI의 lifelong LLM agent roadmap은 이를 perception, memory, action의 세 모듈로 정리하면서 AGI를 향한 continual adaptation의 중요성을 명시한다.

동시에 meta-cognition은 “내가 무엇을 모르는가?”와 “지금 더 배워야 하는가?”를 다룬다. 2026년 systematic review는 self-monitoring, uncertainty calibration, adaptive control, reflective reasoning을 AGI의 adaptive reasoning과 연결한다. Meta-Learning과 결합하면 다음과 같은 상위 제어 루프가 된다.

\[ \text{Meta-Cognition}\rightarrow\text{What should I learn?}\rightarrow\text{Meta-Learning}\rightarrow\text{Adaptation}\rightarrow\text{Re-evaluation} \]
Part IV · Challenges & Research Questions

잘 배우는 것보다 더 어려운 문제는 “무엇이 진짜 학습인지” 증명하는 일이다

Meta-Learning × AGI의 성패는 성능 숫자보다 adaptation의 원인, 전이, 지속성, 안전성을 분리해 측정하는 데 달려 있다.

§13 · Challenges

현재의 핵심 난제

Challenge핵심 질문왜 AGI에서 더 어려운가
Distribution shiftMeta-training 밖의 task에도 적응하는가?Pretraining coverage가 너무 넓어 true novelty를 확인하기 어렵다.
Task inferenceTask label 없이 무엇을 배울지 아는가?규칙·목표·환경 dynamics가 모두 latent일 수 있다.
Exploration정보 가치가 높은 행동을 선택하는가?보상뿐 아니라 정보획득 자체를 최적화해야 한다.
Credit assignment어떤 경험이 improvement를 만들었는가?장기 agent loop에서는 원인이 수십·수백 step 뒤에 나타난다.
Stability–plasticity새것을 배우며 기존 능력을 유지하는가?지속적 update가 competence를 파괴할 수 있다.
Meta-overfittingTask distribution을 외운 것 아닌가?Meta-benchmark 자체가 새로운 memorization target이 된다.
Self-generated error잘못된 self-training data를 증폭하지 않는가?Model이 teacher와 student 역할을 동시에 하면 오류가 순환할 수 있다.
Reward hackingSelf-improvement objective를 편법으로 최적화하지 않는가?Agent가 evaluator·tool·scaffold까지 바꾸면 평가경계가 흔들린다.
Evaluation leakageBenchmark familiarity를 learning으로 오인하지 않는가?Foundation model의 pretraining provenance가 불완전하다.
Compute costTest-time learning 비용이 실용적인가?Search와 fine-tuning을 결합하면 inference cost가 급증한다.
SafetySelf-modification이 통제 경계를 벗어나지 않는가?Architecture·code 수정은 능력과 위험을 함께 바꿀 수 있다.

특히 stability와 plasticity의 긴장은 피할 수 없다. Plasticity만 높으면 과거 능력을 잃고, stability만 높으면 새로운 것을 배우지 못한다.

§14 · Research Questions

Meta-Learning × AGI를 검증 가능한 연구문제로 바꾸기

RQ연구질문
RQ1Agent는 task description 없이 현재 무엇을 배워야 하는지 스스로 식별할 수 있는가?
RQ2새로운 task에서 최소 경험으로 latent rule과 causal structure를 찾을 수 있는가?
RQ3Model weight, context, memory, prompt, tool, planner 중 무엇을 업데이트할지 스스로 선택할 수 있는가?
RQ4Inference와 learning을 하나의 closed loop로 통합할 수 있는가?
RQ5실패한 reasoning/search trajectory를 reusable learning experience로 바꿀 수 있는가?
RQ6단기 test-time adaptation이 장기적인 lifelong intelligence로 축적되는가?
RQ7자기개선이 특정 benchmark가 아닌 새로운 task distribution으로 transfer되는가?
RQ8Uncertainty와 self-knowledge가 learning strategy 선택을 제어할 수 있는가?
RQ9Agent가 새로운 tool과 새로운 action primitive를 스스로 습득할 수 있는가?
RQ10Agent architecture나 learning algorithm 자체를 안전하게 변경할 수 있는가?
RQ11새로운 counter-evidence를 기존 belief 수정에 이용할 수 있는가?
RQ12Skill-acquisition efficiency를 static accuracy와 분리하여 측정할 수 있는가?

특히 RQ12는 AGI 평가와 직결된다. 최종 성공률만 보는 대신, 능력 증가량을 경험·계산·시간으로 나눈 학습 효율을 측정해야 한다.

\[ \text{Skill-Acquisition Efficiency}\;\propto\;\frac{\Delta\text{Capability}}{\text{Experience}+\text{Compute}+\text{Time}} \]
Part V · Approaches

하나의 optimizer가 아니라 “적응 라우터”가 필요하다

각 접근은 서로 다른 상태를 바꾼다. AGI형 시스템은 이들 중 무엇을 호출할지 선택하는 상위 메타-컨트롤러를 요구한다.

§15 · Methods map

현재의 주요 접근을 업데이트 대상별로 분류하기

접근Adaptation 대상Feedback대표 사례
In-Context Meta-LearningHidden state / contextDemonstrations, prompt evidenceICL meta-learning theory
Test-Time TrainingParameters / LoRASelf-supervised test signalTLM
Self-Generated Fine-tuningModel parametersDownstream performanceSEAL
Meta-RLPolicy / internal stateReward, interaction historyAdaptive agent lineage
Evolutionary Search + LearningProgram / search policyExecution resultSOAR
Continual LearningParameters / memorySequential dataLLM continual learning
Memory AdaptationEpisodic / semantic memoryRetrieval usefulnessLifelong agents
Prompt EvolutionPrompt / instructionTask successSelf-improving agents
Tool Meta-LearningTool-selection policyTask feedbackAgent systems
Agent-Code EvolutionScaffold / source codeBenchmark feedbackGödel Agent, DGM
Metacognitive ControlReasoning / learning strategyUncertainty, confidenceAdaptive reasoning
World-Model LearningTransition modelEnvironment interactionARC-AGI-3 style agents
§16 · Integrated architecture

Meta-Controller와 Learning Router

통합형 구조에서 중요한 것은 모든 메커니즘을 한꺼번에 실행하는 것이 아니다. 현재 상태와 uncertainty를 보고 어떤 종류의 adaptation이 가장 높은 기대가치를 갖는지 선택해야 한다.

Novel Environment새 문제·새 규칙·새 데이터 분포
Perception & World ModelObservation을 구조화하고 현재 belief를 만든다
Meta-CognitionNovelty, confidence, uncertainty, knowledge gap을 추정한다
Meta-ControllerReason / Search / Ask / Experiment / Act 중 하나를 선택한다
Experience & Critic결과, 실패, counter-evidence, cost를 평가한다
Learning RouterContext / Memory / Weights / Tool / Planner / Agent Code 중 수정 대상을 선택한다
Updated Intelligence다음 task에서 더 빠른 학습으로 이어지는지 검증한다

Meta-Controller는 “행동을 선택”하고 Learning Router는 “학습의 위치를 선택”한다. 두 기능을 분리하면 어떤 improvement가 어디에서 발생했는지 실험적으로 추적하기 쉬워진다.

Part VI · Open Problems

“성능이 올랐다”와 “학습했다” 사이에는 큰 간격이 있다

AGI형 Meta-Learning이 성립하려면 memorization, search, adaptation, transfer, belief revision을 구별해야 한다.

§17 · True novelty

처음 보는 문제인가, 이미 본 문제를 재생하는가

Foundation Model은 방대한 corpus로 pretraining되므로 benchmark task가 정말 unseen인지 확인하기 어렵다. ARC Prize 2025 report가 지적하듯 frontier reasoning의 성능은 knowledge coverage와 benchmark contamination 문제에서 자유롭지 않다. Memorized knowledge와 newly acquired skill을 분리하지 못하면 Meta-Learning을 측정할 수 없다.

§18 · Search vs Learning

더 많이 시도한 것인가, 실제로 전략이 달라진 것인가

많은 후보를 생성해 최선의 것을 고르는 brute-force search와, 실패를 분석해 내부 strategy를 바꾸고 이후 시도 전체를 개선하는 learning은 다르다. 따라서 같은 compute budget 아래에서 search-only baseline과 adaptation-enabled model을 분리해 비교해야 한다.

Search-only

1000개의 후보를 만들고 best candidate를 선택한다. 다음 task에서 sampler 자체는 달라지지 않는다.

Actual learning

Failure trace가 strategy, representation, memory 또는 parameters를 바꾸며 이후 attempt의 분포가 달라진다.

§19 · Transfer

Task T1에서 배운 것이 T2의 학습 속도를 높이는가

Meta-Learning의 진짜 검증은 \(T_1\)에서 학습해 \(T_1\) 점수가 오른다는 데 있지 않다. 더 강한 test는 다음과 같다.

\[ T_1\text{에서 학습}\quad\Longrightarrow\quad T_2,T_3,T_4\text{의 학습 속도 증가} \]

즉 평가 대상은 task performance가 아니라 learning-to-learn transfer이다.

§20 · Negative experience

실패를 기억하지 못하면 같은 실험을 반복한다

현재 self-improving system은 성공한 trajectory와 positive example을 활용하는 데 집중하는 경향이 있다. 그러나 AGI에는 failed hypothesis, invalid strategy, negative evidence, failed experiment도 장기 memory에 남아야 한다. 단순한 episodic storage를 넘어 “다시 시도하지 말아야 하는 조건”까지 표현할 필요가 있다.

§21 · Belief revision

새 evidence는 지식에 append되는 것이 아니라 기존 belief를 바꿔야 한다

\[ K_{t+1}=\operatorname{Revise}(K_t,E_{\text{counter}}) \]

Counter-evidence가 기존 belief와 충돌할 때 단순히 memory에 추가하는 것으로는 충분하지 않다. confidence를 낮추고, 조건을 분리하고, 잘못된 relation이나 policy를 철회해야 한다. 이 지점에서 Meta-Learning은 continual learning, epistemic reasoning, uncertainty calibration과 결합한다.

Part VII · Future Directions

다음 단계는 “배울수록 더 잘 배우는 Agent”다

향후 연구의 핵심은 adaptation을 한 task의 기술이 아니라 장기적 지능 축적 메커니즘으로 바꾸는 것이다.

§22 · Roadmap

Inference-time adaptation에서 architecture-level self-improvement까지

PHASE 1
Inference-Time Adaptation

ICL, test-time search, TTL을 이용해 같은 task 안에서 빠르게 적응한다.

PHASE 2
Experience-Driven Agents

Interaction → experience → memory → policy change를 연결한다.

PHASE 3
Continual Meta-Learning

Task가 누적될수록 다음 task의 학습 효율이 증가하도록 한다.

PHASE 4
Meta-Cognitive Learning

“내가 무엇을 모르는가”를 판단하고 search, ask, simulate, learn 중 전략을 선택한다.

PHASE 5
Architecture-Level Self-Improvement

Model, memory, planner, tools, agent scaffold를 모두 adaptation 대상으로 삼되 검증·안전 경계를 유지한다.

§23 · Priority topics

AGI 관점에서 특히 중요한 연구주제 Top 5

01 · Meta-Cognitive Continual Meta-Learning

Knowledge gap과 uncertainty를 감지한 뒤 학습전략을 선택하고, 그 결과를 장기 memory와 belief에 반영한다.

02 · Agentic Test-Time Learning

Reasoning–action–feedback–learning을 하나의 task loop로 통합하고 update target을 동적으로 선택한다.

03 · Learning-to-Explore Meta-RL

당장의 보상보다 미래 학습에 필요한 정보를 얻는 행동을 선택한다.

04 · Self-Improving Agent Architectures

Model뿐 아니라 memory, tool, planner, prompt, scaffold를 수정하되 improvement provenance를 추적한다.

05 · Falsifiable Skill-Acquisition Evaluation

Memorization, search, task-specific tuning과 실제 transferable learning을 분리하는 benchmark와 metric을 설계한다.

§24 · Paradigm shift

2017–2026의 흐름을 한 줄로 읽기

2017–2023
Few-shot Meta-Learning

몇 개의 example로 새로운 task를 빠르게 학습하는 것이 중심이었다.

2023–2024
In-Context Learning

Weight update 없이 context 안에서 task를 추론하고 적응하는 능력이 부상했다.

2025
Test-Time & Self-Improving Loops

TLM, SEAL, SOAR, Gödel Agent, DGM이 inference 이후의 adaptation space를 넓혔다.

2026
Interactive / Agentic Learning

ARC-AGI-3, lifelong agents, meta-cognition, self-improving agent surveys가 탐색·기억·자기수정을 하나의 문제로 묶기 시작했다.

NEXT
Continual Meta-Cognitive Self-Improvement

배울수록 다음 학습이 빨라지고, 자신의 uncertainty와 update policy까지 개선하는 시스템이 핵심 연구대상이 된다.

§25 · Final synthesis

Meta-Learning은 AGI의 “적응 엔진”에서 “폐쇄루프 지능”으로 확장된다

\[ \begin{aligned} \text{Meta-Learning for AGI} =\;&\text{Novelty Detection}+\text{Task/Goal Inference}\\ &+\text{Learning Strategy Selection}+\text{Test-Time Adaptation}\\ &+\text{Exploration}+\text{Memory Consolidation}+\text{Continual Learning}\\ &+\text{Belief Revision}+\text{Agent Self-Modification} \end{aligned} \]

따라서 “Meta-Learning × AGI”를 MAML류의 빠른 파라미터 적응으로만 정의하면 현재의 연구지형을 놓친다. 더 적절한 관점은 reasoning → experience → learning → revision → better reasoning의 폐쇄루프를 어떻게 구성하고 검증할 것인가이다.

2025년 이후의 frontier는 “새로운 task를 빨리 푸는 모델”에서 “새로운 세계에 들어가 무엇을 배워야 하는지 발견하고, 경험을 통해 자신의 reasoning·memory·policy·tools·architecture를 지속적으로 개선하는 Agent”로 이동하고 있다.Synthesis across the reviewed literature

이 흐름을 연구주제로 더 밀어붙인다면 Falsifiable Continual Meta-Learning for Self-Improving Agentic AGI가 유망하다. 핵심은 self-improvement를 주장하는 것이 아니라, 새로운 문제에서 uncertainty → hypothesis → exploration → feedback → memory → belief revision → transfer가 실제로 발생했음을 검증할 수 있는 architecture와 benchmark를 함께 제안하는 것이다.

References · verified sources

핵심 2025–2026 문헌

01
Hoppmann & Scholz — Meta-Learning and Meta-Reinforcement Learning: Tracing the Path towards DeepMind's Adaptive Agent
arXiv · 2026

Meta-Learning과 Meta-RL의 계보를 generalist adaptive agent까지 연결하는 survey.

https://arxiv.org/abs/2602.19837
02
Wakayama & Suzuki — In-Context Learning Is Provably Bayesian Inference: A Generalization Theory for Meta-Learning
arXiv · 2025/2026 revision

ICL을 meta-learning framework에서 finite-sample generalization 관점으로 분석한다.

https://arxiv.org/abs/2510.10981
03
Braccaioli et al. — Meta-Learning Transformers to Improve In-Context Generalization
arXiv · 2025

Curated domain-specific dataset collection을 활용한 meta-training과 unseen-domain ICL을 다룬다.

https://arxiv.org/abs/2507.05019
04
Hu et al. — Test-Time Learning for Large Language Models
ICML · 2025

Unlabeled test data, input perplexity, sample-efficient selection, LoRA를 이용한 LLM test-time adaptation.

https://proceedings.mlr.press/v267/hu25z.html
05
Wang et al. — How Far Can LLMs Improve from Experience? Measuring Test-Time Learning Ability in LLMs with Human Comparison
arXiv · 2025

Static benchmark와 경험 기반 test-time learning ability를 분리해 인간과 비교한다.

https://arxiv.org/abs/2506.14448
06
Zweiger et al. — Self-Adapting Language Models (SEAL)
NeurIPS · 2025

LLM이 자신의 fine-tuning data와 update directive를 생성하고 downstream performance로 self-edit를 학습한다.

NeurIPS paper page
07
Pourcel, Colas & Oudeyer — Self-Improving Language Models for Evolutionary Program Synthesis: A Case Study on ARC-AGI
ICML · 2025

SOAR: evolutionary search와 hindsight learning을 순환시켜 search model 자체를 개선한다.

https://proceedings.mlr.press/v267/pourcel25a.html
08
Yin et al. — Gödel Agent: A Self-Referential Agent Framework for Recursively Self-Improvement
ACL · 2025

LLM이 자신의 agent logic과 behavior를 동적으로 수정하는 self-evolving framework.

https://aclanthology.org/2025.acl-long.1354/
09
Zhang et al. — Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents
arXiv · 2025, revised 2026

Coding agent code를 반복 수정하고 empirical benchmark로 검증하며 archive 기반 open-ended exploration을 수행한다.

https://arxiv.org/abs/2505.22954
10
Chollet et al. — ARC Prize 2025: Technical Report
arXiv · 2026

ARC-AGI-2 경쟁과 2025년 refinement loop의 부상, knowledge-dependent overfitting을 분석한다.

https://arxiv.org/abs/2601.10904
11
ARC Prize Foundation — ARC-AGI-3: A New Challenge for Frontier Agentic Intelligence
Technical Report · 2026

Novel interactive environments에서 exploration, goal inference, world-model building, planning과 adaptive efficiency를 평가한다.

https://arxiv.org/abs/2603.24621
12
Wang et al. — Recent Advances of Foundation Language Models-based Continual Learning: A Survey
ACM Computing Surveys · 2025

Foundation language model의 continual learning과 catastrophic forgetting 문제를 체계화한다.

https://doi.org/10.1145/3705725
13
Shi et al. — Continual Learning of Large Language Models: A Comprehensive Survey
ACM Computing Surveys · 2025

Vertical continuity와 horizontal continuity, continual pretraining·adaptation·fine-tuning을 정리한다.

https://doi.org/10.1145/3735633
14
Zheng et al. — Lifelong Learning of Large Language Model Based Agents: A Roadmap
IEEE TPAMI · 2026

Perception, memory, action을 중심으로 lifelong LLM agent와 AGI를 연결한다.

https://ieeexplore.ieee.org/document/11328884/
15
Bohra, Wagle & Patil — A systematic review of meta-cognitive approaches to AGI
Discover Artificial Intelligence · 2026

Self-monitoring, uncertainty calibration, adaptive control, reflective reasoning과 AGI를 체계적으로 검토한다.

https://link.springer.com/article/10.1007/s44163-026-01401-1
16
Ren et al. — Self-Improvements in Modern Agentic Systems: A Survey
arXiv · 2026

Foundation model과 prompts, memory, tools, control logic을 결합한 agent를 self-induced update operator 관점에서 정리한다.

https://arxiv.org/abs/2607.13104
17
Cho & Sun — Hierarchical Meta-Reinforcement Learning
Scientific Reports · 2026

Task representation, task-agnostic macro-action, primitive action의 세 계층으로 복잡한 task의 sample-efficient fast adaptation을 다룬다.

https://www.nature.com/articles/s41598-026-57247-1