◆ AGI / BELIEF AND COHERENCE
RESEARCH WATCH · SOURCE DATE 2026-10-04

기억에서 믿음 상태로,
검색에서 연구의 전진으로

AGI Research Watch: Belief States, Global Coherence, and Research Catalysis

PoS의 명시적 믿음 상태, 다중 에이전트의 전역 일관성, ScholarCatalyst의 연구 아이디어 검색을 상태와 행동의 관점에서 분석한다.현재의 믿음 · 공유 상태 · 연구의 전진의 관계를 연결한 해석적 개념도. 실측 자료가 아닌 해석적 구조다.현재의 믿음01 / EVIDENCE공유 상태02 / REASONING연구의 전진03 / VALIDATIONNEW EVIDENCE / REVISION
핵심 연구축과 증거 환류를 연결한 개념도 · 제안과 실증의 구분은 각 절을 따른다.
RESEARCH QUESTION

PoS의 명시적 믿음 상태, 다중 에이전트의 전역 일관성, ScholarCatalyst의 연구 아이디어 검색을 상태와 행동의 관점에서 분석한다.

조사 기록과 근거 수준

게시 기준일: 2026-10-04. 본문에 명시된 문서 기준일·갱신일을 게시 기준일로 사용한다. 원문에 명시된 개별 발표일과 검색 기간은 본문에 보존했다. 공개 평가 세트, 제한된 실험 조건, 상대 향상과 비용 기준을 보존한다. 본문의 통합 아키텍처는 여러 연구를 연결한 해석이며 일반지능의 입증을 뜻하지 않는다.

PART 01

연구 범위와 핵심 질문

AGI 연구동향 업데이트 — 2026년 10월 4일

이번 확인에서는 기존 추적에서 아직 다루지 않았고, AGI 연구방향을 바꿀 가능성이 충분히 높은 신규 변화 3건만 선별했다. 세 연구가 가리키는 방향은 서로 연결된다. Long-horizon agent에서는 “더 많이 기억하는 것”보다 현재 세계에 대한 믿음을 일관되게 유지하는 것이 중요해지고, multi-agent에서는 모델 지능을 높여도 복구할 수 없는 shared-state 한계가 명시적으로 제기됐으며, Autonomous AI Scientist에서는 ‘관련 논문 검색’과 ‘실제로 연구를 전진시키는 아이디어를 찾는 능력’이 별개의 capability라는 점이 새로운 benchmark로 측정되기 시작했다.

PART 02

Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States

발표일: 2026년 10월 1일
영역: Long-Horizon Agents · Lifelong Memory · World Models · Agent Reasoning

이 논문이 제기하는 핵심 문제는 현재의 agent memory가 과거 정보를 저장·압축하는 데는 능숙해졌지만, “지금 세계가 어떤 상태인가?”를 일관되게 표현하지는 못한다는 것이다. 긴 trajectory에서는 과거에는 맞았지만 현재는 틀린 정보, agent가 중간에 만든 추론, 실제 관찰 evidence가 섞이기 때문에 memory를 더 많이 보존한다고 문제가 해결되지 않는다. 저자들은 이를 해결하기 위해 PoS(Progression of States)를 제안한다. PoS는 현재 세계상태 \(W_t\), 목표 \(G\), 아직 알아내야 하는 epistemic gap, 아직 행동으로 달성해야 하는 achievement gap을 하나의 명시적 belief state로 유지한다. arXiv

중요한 점은 belief를 단순 summary로 저장하는 데 그치지 않는다는 것이다. Belief Sentinel이 새 belief가 관찰 evidence와 모순되는지 계속 검사하며, agent가 행동은 계속 하지만 실제 목표에는 전혀 가까워지지 않는 상태를 Belief Trapping으로 정의한다. PoS는 gap persistence, progress stagnation, belief recurrence를 이용해 static·cycle·drift 형태의 trapping을 감지하고, 종료하는 대신 현재 episode 안에서 recovery action을 생성한다. arXiv

세 가지 LLM backbone과 ALFWorld, LOCA-Bench, RCA-100, ClinDiag의 네 benchmark에서 모든 backbone–benchmark 조합에서 가장 높은 전체 성능을 보고했으며, strongest baseline 대비 상대 향상은 **ALFWorld 최대 22.68%, RCA-100 joint accuracy 최대 37.89%**였다. Context가 길어져도 성능저하가 상대적으로 작았고, consistency validation이나 trapping recovery를 제거하면 성능이 하락했다. arXiv

기존 연구 대비 차이: 최근 agent-memory 연구의 중심은 대체로

\[ History \rightarrow Compress / Retrieve / Summarize \rightarrow Context \]

였다. PoS가 주장하는 전환은 다음과 같다.

\[ \boxed{ History\ Management \rightarrow Current\ Belief\ Management } \]

즉 long-horizon agent에게 필요한 것은 “무엇을 기억할까?”만이 아니라,

\[ \boxed{ \text{What do I currently believe?} + \text{Why do I believe it?} + \text{What remains unresolved?} } \]

이다.

연구적 의미: 이 결과가 후속 연구에서 재현된다면 AGI memory architecture의 평가기준도 달라질 가능성이 큽니다. compression ratio, retrieval accuracy, context length보다 belief consistency, provenance, stale-state removal, epistemic-gap closure, belief-trap recovery가 더 중요한 지표가 됩니다.

이는 world model 연구와 memory 연구의 경계도 흐립니다. 장기 agent의 memory는 단순 archive가 아니라 사실상 지속적으로 수정되는 symbolic/semantic world state가 되어야 한다는 방향이다.

arXiv — Beyond Memory: Harnessing Long-Horizon Agents with Explicit Belief States


PART 03

Global Coherence: When Every Agent Is Right and the Team Is Still Wrong

발표일: 2026년 10월 1일
영역: Multi-Agent AGI · Long-Horizon Agents · Scalable Oversight · Agent Architecture

이 논문은 최근 multi-agent 연구에서 매우 중요한 질문을 던집니다.

각 agent가 자기 관점에서는 올바른 결정을 내려도 전체 시스템은 틀릴 수 있는가?

저자는 이를 global coherence problem으로 정의하고, 원인이 반드시 모델의 reasoning 부족이 아니라 각 agent가 서로 다른 불완전한 세계상태를 보고 있기 때문일 수 있다고 주장한다. 제시된 Observation-Aliasing Impossibility Theorem에 따르면 동일한 observation으로 구별되지 않는 여러 실제 world state가 서로 다른 admissible action을 요구한다면, 추론을 더 길게 하거나 agent·message·sample 수를 늘려도 부족한 정보를 복구할 수 없다. \(k\)개의 구별 불가능한 상태가 서로 배타적인 행동을 요구할 경우 randomized policy의 worst-case 성공률도 \(1/k\)로 제한된다고 논문은 정식화한다. arXiv

실험도 이 주장을 겨냥한다. 결정에 필요한 사건이 agent에게 보이는 controlled task에서는 같은 frontier model이 40/40을 달성했지만, 해당 정보를 숨기면 여러 실험조건에서 12–17/40, 즉 약 1/3 chance 수준으로 하락했다. 단 하나의 authoritative fact를 다시 제공하면 40/40으로 복구됐다. TeamBench에서는 일반 multi-agent team이 공통 budget을 5/5 run에서 위반했고, live count를 보이게 해도 4/5가 실패했지만, harness가 commit 자체를 강제하면 위반이 0/5가 됐다. tau2-bench Telecom의 silent-revert 조건에서도 current-state checking은 0.07, harness-managed state는 1.00을 보고한다. arXiv

기존 연구 대비 차이: 기존 multi-agent AGI의 대표적 접근은

\[ \text{better agent} + \text{more communication} + \text{more debate} \rightarrow \text{better system} \]

에 가까웠다.

이 논문은 그 아래에 정보론적·상태관리적 한계가 존재한다고 주장한다.

\[ \boxed{ \text{Local Intelligence} \not\Rightarrow \text{Global Coherence} } \]

그리고 해결책을 모델 prompt가 아니라 runtime architecture에 둡니다.

\[ \boxed{ \text{Models propose;} \quad \text{Harness owns state and commit.} } \]

즉 shared state와 실제 state-changing commit 권한을 LLM 밖의 authoritative control plane이 가져야 한다는 것이다. arXiv

연구적 의미: 최근 추적한 communication-layer alignment, compositional safety, permission-calibrated agency보다 한 층 더 근본적인 문제이다. 앞으로 multi-agent AGI 평가에서는 각 agent의 정답률뿐 아니라 shared-state consistency, authoritative-state visibility, commit serialization, rollback semantics, cross-agent causal coherence를 독립적으로 측정해야 할 가능성이 높다.

특히 중요한 것은 더 강한 모델이 해결하지 못하는 시스템 문제의 존재이다. 이 주장이 재현된다면 multi-agent AGI의 확장은 “더 똑똑한 subagent를 더 많이 붙이기”보다는 데이터베이스·분산시스템처럼 state ownership과 transaction semantics를 설계하는 문제에 가까워집니다.

다만 현재는 단일 저자의 신규 arXiv preprint이므로, theorem의 적용범위와 benchmark 결과에 대한 독립 재현은 필요한다. 그럼에도 “model intelligence와 system coherence를 분리해야 한다”는 문제설정 자체는 추적 가치가 높다. arXiv

arXiv — Global Coherence


PART 04

ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research

발표일: 2026년 10월 1일
영역: Autonomous AI Scientist · AGI Evaluation · Scientific Reasoning · Research Taste

ScholarCatalyst는 Autonomous AI Scientist의 병목을 문헌검색 정확도가 아니라 “어떤 기존 아이디어가 아직 완성되지 않은 연구문제를 실제로 전진시킬 것인가?”를 알아보는 능력으로 바꿔 측정한다. 연구진은 최근 computer-science 논문 207편의 lead author 184명에게 실제 자신의 연구를 발전시키는 데 도움이 됐거나 도움이 될 수 있었던 선행논문을 직접 표시하게 하고 그 이유까지 수집했다. 평가할 때는 미래정보 누출을 막기 위해 그 프로젝트가 시작됐을 당시 이용 가능했던 문헌만 후보로 사용한다. arXiv

결과가 특히 흥미롭다. 일반적인 embedding retrieval의 Recall@20이 0.48이었는데, 그 retriever를 tool로 사용할 수 있는 agentic search는 0.42로 오히려 낮았다. 심지어 완성된 논문을 학습 중 봤을 가능성이 있는 Claude Fable 5.1 기반 agent도 0.51 R@20에 머물렀다. 즉 더 복잡한 agent loop와 더 강한 모델만으로 인간 연구자의 “이 논문이 바로 이 문제에 필요하다”는 intuition을 재현하지 못했다. arXiv

기존 연구 대비 차이: 일반 scientific-RAG benchmark는 보통

\[ Question \rightarrow Relevant\ Documents \]

를 평가한다.

ScholarCatalyst가 묻는 것은 다릅니다.

\[ \boxed{ Early\ Research\ Question \rightarrow \text{Prior idea capable of changing the project} } \]

이는 단순 relevance와 catalytic relevance를 분리한다.

앞서 추적한 The Tasteful Agent는 이미 trajectory 안에서 어느 연구방향을 선택할지를 측정했고, Claude-shaped science는 실제 현장에서 AI가 technical execution은 잘하지만 인간의 scientific taste가 여전히 중요하다고 보고했다. ScholarCatalyst는 이제 그 scientific taste의 또 다른 구성요소인 idea sourcing / inspirational retrieval을 독립 benchmark로 만들었다는 점에서 의미가 있다. arXiv

연구적 의미: 향후 Autonomous AI Scientist benchmark는 다음 두 종류의 검색을 분리하게 될 가능성이 높다.

\[ \text{Evidence Retrieval} \neq \text{Idea Retrieval} \]

첫 번째는 “내 주장에 어떤 논문이 근거가 되는가?”이고, 두 번째는

\[ \boxed{ \text{“내가 아직 생각하지 못한 어떤 과거 아이디어가 이 연구의 다음 방향을 열어주는가?”} } \]

이다.

후자는 hypothesis generation, analogy, cross-domain transfer, research taste와 직접 연결된다. 따라서 Scientific AGI의 retrieval system도 단순 vector similarity 최적화에서 counterfactual usefulness, conceptual transferability, novelty contribution을 학습하는 방향으로 이동할 가능성이 큽니다.

arXiv — ScholarCatalyst


PART 05

종합 전망

이번 세 연구를 연결하면 최근 AGI 연구에서 꽤 중요한 구조가 보이다.

\[ \boxed{ \begin{aligned} \text{Lifelong Agent}:& \quad \text{Memory} \rightarrow \mathbf{Belief\ State}\\[1mm] \text{Multi-Agent AGI}:& \quad \text{More Intelligence} \rightarrow \mathbf{Authoritative\ Shared\ State}\\[1mm] \text{AI Scientist}:& \quad \text{Relevant Search} \rightarrow \mathbf{Research\ Catalysis} \end{aligned}} \]

세 경우 모두 공통적으로 **“더 많은 정보”가 아니라 “어떤 상태·정보가 실제 다음 행동을 결정해야 하는가”**가 핵심 문제가 됩니다.

따라서 현재 새롭게 우선 추적할 가치가 높은 축은 Belief-State-Centric Long-Horizon Agents, Global-State / Commit Semantics for Multi-Agent AGI, 그리고 **Scientific Catalysis & Research Taste Benchmarks**이다. 이는 AGI의 다음 병목이 단순 reasoning scale보다 상태의 일관성, 권위 있는 세계표현, 그리고 어떤 지식이 행동·발견을 실제로 변화시키는지를 판단하는 능력으로 이동하고 있다는 신호로 보는 것이 적절한다.

SOURCE RECORD

자료와 출처

구성 자료: AGI-Trends-1004.md. 첨부의 모든 연구 항목, 비교, 수치, 표, 수식, 한계와 후속 연구 제안을 수록했다. 대화 시스템의 인용 표시와 알림 문구는 편집 과정에서 제거했다. 본문 링크는 해당 자료로 연결된다.

  1. arXivarxiv.org · PRIMARY SOURCE / RESEARCH RESOURCE
  2. arXivarxiv.org · PRIMARY SOURCE / RESEARCH RESOURCE
  3. arXivarxiv.org · PRIMARY SOURCE / RESEARCH RESOURCE