AI Research NotesMission-to-Portfolio Intelligence · Evidence · Execution · Revision
Institutional AI Co-StrategistResearch Watch · 31 Aug 2026Agentic RAG · HRKG · AQP · Omni-Modal Reasoning

From Hypothesis-Generating Co-Scientists
to Execution-Grounded
Institutional Co-Strategists

Mission-to-Portfolio Intelligence that knows when evidence is sufficient, what obligations remain, and when a strategy must change.

Execution-Grounded Institutional Co-StrategistNational mission flows through agentic retrieval, evidence sufficiency, obligation graphs, approximate-to-exact processing, omni-modal verification, portfolio optimization, execution monitoring and continual revision.MISSION+ PORTFOLIOAGENTICRAGEVIDENCESUFFICIENCYOBLIGATIONGRAPHAPPROX.TO EXACTOMNI-MODALVERIFYPORTFOLIOOPTIMIZEEXECUTE → EVIDENCE→ KPI → REVISEPlan only with enough evidence. Execute. Observe. Re-open the decision.
Research Update

이번 점검에서는 의미 있는 변화가 확인됐다. 특히 2026년 8월 중순 이후 발표된 연구들을 보면, 우리가 앞서 정의한 “AI Co-Scientist → AI Co-Strategist → Mission-to-Portfolio Intelligence” 방향을 강화하는 신호가 뚜렷하다. 가장 중요한 변화는 AI가 단순히 아이디어·가설을 생성하는 단계를 넘어 실행 상태, 증거 충분성, 검증 조건, 장기 연구상태를 관리하는 시스템으로 이동하고 있다는 점이다.

Mission → Portfolio → Execution → Evidence → KPI Evaluation → RevisionThe strategy itself becomes a revisable execution state.
Part I · Execution Loop

1. AI Co-Scientist가 “가설 생성”에서 “실행 기반 폐루프 연구”로 넘어가기 시작했다

2026년 8월 27일 공개된 Accelerating Scientific Research with Gemini in the Real-World는 이번 점검에서 가장 중요한 논문이다. Google DeepMind·Google Research 등의 연구진은 Co-Scientist를 기존의 in-silico 가설 생성 도구에서 확장하여, 재료과학·생물학·컴퓨터과학에서 가설 생성 → 실험계획 → 실제 실험/코드 실행 → 결과분석 → 논문 생성까지 연결되는 closed-loop 연구 파트너로 제시했다. 재료과학에서는 반자동 CVD 장비와 연계했고, 논문 생성 단계에서도 실행 로그와 결과를 검증하는 reliability mechanism을 포함했다. 아직 arXiv preprint라는 점은 구분해야 하지만, AI Co-Scientist 연구의 방향 자체가 “생각하는 AI”에서 “실행하고 검증받는 AI”로 이동하고 있다는 강한 신호다. (arXiv)

이 변화는 출연연 AI 연구기획에 직접적인 의미가 있다. 이제 목표형상·핵심기술·KPI를 생성하는 AI만으로는 부족하고,

Mission → Portfolio → Execution → Evidence → KPI Evaluation → Revision

을 폐루프로 연결해야 한다. 즉 전략사업을 만들어 놓고 끝나는 것이 아니라, 과제 수행 중 논문·특허·실험결과·TRL·기술이전·KPI 실적이 들어올 때마다 전략을 다시 평가하여 Maintain / Accelerate / Merge / Pivot / Stop을 결정하는 Execution-Grounded AI Co-Strategist가 더 강한 연구문제가 된다.

Accelerating Scientific Research with Gemini in the Real-World

Part II · Evidence Sufficiency

2. Agentic RAG의 핵심문제가 “무엇을 검색할까?”에서 “증거가 이제 충분한가?”로 이동하고 있다

2026년 8월 25일 공개된 MetaRAG: Belief-Action Aligned Policy Optimization for Agentic RAG는 출연연 연구기획과 AQP를 결합하는 데 매우 중요한 연구다. MetaRAG는 Agentic RAG의 retrieval decision을 belief–action alignment 문제로 재정의한다. 에이전트가 계속 검색할지 답을 낼지 결정하기 전에 Verify-first 과정을 수행하고, 현재 evidence만으로 답할 수 있는지에 대한 자신의 belief를 추정한다. 7개 QA benchmark에서 accuracy–efficiency trade-off 개선을 보고한다. 역시 현재는 preprint다. (arXiv)

이 결과를 연구기획 문제로 옮기면 상당히 강한 신규 연구주제가 나온다.

“현재 확보한 논문·특허·기관역량·시장·표준 증거만으로 특정 전략사업을 채택/폐기해도 되는가?”

라는 Evidence Sufficiency Problem이다.

여기에 AQP를 결합하면 다음과 같은 새로운 DB 문제가 된다.

\[P(\text{portfolio decision is unchanged}\mid E_{sample}) \ge 1-\delta\]

를 만족하는 최소 evidence subset을 찾는 것이다.

즉 모든 논문·특허·시장자료를 검색하는 것이 아니라 전략적 의사결정을 바꾸지 않을 정도로 충분한 증거가 모이는 순간 retrieval을 중단한다.

이 방향의 논문 제목으로는

Belief-Calibrated Approximate Evidence Processing for Agentic Mission Planning

을 추천한다. SIGMOD/VLDB 관점에서 매우 좋은 문제다.

기존 AQP 연구에서도 AI workflow를 declarative query로 보고 confidence interval과 proxy model을 이용하여 expensive model invocation을 줄이는 방향이 이미 등장했다. 2026년 6월의 Query-Centric Optimization of AI Workflows via Approximate Query Processing and Proxy Models는 이러한 방향을 직접적으로 보여준다. (arXiv)

MetaRAG: Belief-Action Aligned Policy Optimization for Agentic RAG

Part III · Mission Obligations

3. 장기 연구 AI에서 “Agent들의 역할”보다 “작업구조를 동적으로 구성하는 Meta-Agent”가 중요해지고 있다

2026년 8월 19일 공개된 Eureka: Task-Conditioned Meta-Agent Orchestration for Scientific Discovery는 장기 과제를 dynamic obligation graph로 컴파일하고, 각 obligation에 명시적 acceptance semantics를 부여하는 구조를 제안한다. 실행 중에는 필요한 agent, memory, tool, verifier를 동적으로 조합하고 반복적으로 나타나는 병목에 따라 architecture 자체도 수정한다. 저자들은 170개의 recursive task와 수천 개의 verification certificate 결과를 보고하지만, 이 또한 최신 preprint이므로 독립적 검증은 필요하다. (arXiv)

이 구조는 출연연 Mission-to-Portfolio AI와 놀랄 정도로 잘 맞는다. 기존에는

Mission → Target Shape → Core Technology → KPI

를 단순 hierarchy로 생각했지만, 앞으로는 이를 Obligation Graph로 정의하는 편이 더 강하다.

예를 들어 국가 미션 하나가 다음의 의무를 생성한다.

Mission M → Capability Obligation C₁ → Technology Obligation T₁,T₂ → Validation Obligation V → KPI Obligation K → Translation Obligation B

각 노드는 단순한 텍스트가 아니라 acceptance condition + evidence + verifier + deadline + owner + uncertainty를 가진다.

Hyper-Relational Graph는 바로 이 qualifier를 저장하는 기반이 된다.

따라서 새로운 연구주제로

Mission Obligation Graphs: A Hyper-Relational Execution Model for Autonomous R&D Planning

을 제안할 수 있다.

이것은 HRKG를 단순 link prediction 데이터 구조가 아니라 전략사업의 실행 가능한 계약(executable research contract)으로 재해석한다는 점에서 신규성이 높다.

Eureka: Task-Conditioned Meta-Agent Orchestration for Scientific Discovery

Part IV · Recoverable Strategy

4. 장기 AI 연구에서는 “memory”보다 “복구 가능한 연구상태”가 중요한 연구주제가 되고 있다

8월 14일 공개된 ScienceFlow도 중요한 신호다. 이 논문은 장기간 수행되는 연구를 단순 dialogue history가 아니라 recoverable executable state들의 연속으로 표현한다. 연구가 막히면 이전 상태로 돌아가 다른 경로를 탐색하고, evidence와 compute budget을 이용하여 다음 실행을 결정한다. 저자들은 MLE-bench를 포함한 장기 연구과제에서 이 접근을 평가했다. (arXiv)

출연연 기획에서는 이 개념을 다음과 같이 확장할 수 있다.

기존 전략기획:

2027–2031 전략계획.pdf

미래 전략기획:

Strategic State (S_t) → evidence update → (S_{t+1}) → rollback / branch / merge / terminate

즉 전략기획 문서는 static document가 아니라 versioned executable strategy state가 된다.

이는 앞서 제안했던 Continual Strategy Graph를 더 강하게 뒷받침한다.

가장 좋은 연구문제는

“어떤 새로운 evidence가 기존 전략사업을 수정할 만큼 충분히 중요한가?”

가 된다.

이것은 Temporal HRKG + Agentic RAG + change detection + portfolio optimization을 연결하는 매우 좋은 연구문제다.

ScienceFlow: A long-horizon agent for ML research, scientific discovery and beyond

Part V · Constraint Fidelity

5. Omni-Modal Scientific Reasoning에서는 “정답”과 “제약조건 준수”를 분리 평가하는 방향이 나타났다

2026년 8월 26일 공개된 SciMIF: Understanding Multimodal Instruction Following in Scientific Domains도 출연연 AI 기획에 상당히 중요한 benchmark 신호다. SciMIF는 화학·생물학·물리·재료 등 5개 과학분야의 22개 task를 바탕으로 10종의 constraint group을 정의한다. 흥미로운 결과는 모델 크기가 증가한다고 해서 scientific instruction adherence가 자동으로 좋아지지 않으며, 특히 세밀한 도메인 제약조건과 화학분야에서 어려움이 크다는 점이다. (arXiv)

이 결과는 AI 연구기획 benchmark 설계에 직접 적용해야 한다.

AI가 제안한 연구사업이 과학적으로 그럴듯하더라도 다음 조건 중 하나를 어기면 실제 출연연 기획으로는 실패다.

예산 ≤ B, 기간 ≤ 5년, TRL 목표 충족, 기관 R&R 부합, 특정 연구소가 수행 가능, 중복사업 금지, 정량 KPI 필요, 공공성과/사업화 경로 필요.

따라서 InstPlanBench에서는 최소한 두 종류의 점수를 분리해야 한다.

평가축질문
Strategic Correctness이 연구사업이 실제로 좋은 연구인가?
Constraint Faithfulness주어진 국가미션·기관역할·예산·기간·KPI 조건을 모두 지켰는가?
Evidence Grounding근거가 실제 논문·특허·성과에 존재하는가?
Portfolio Consistency다른 사업과 중복·모순되지 않는가?
Temporal Validity근거와 목표가 해당 시점에서도 유효한가?

즉 Omni-Modal Scientific Reasoning은 단순히 여러 modality를 이해하는 능력이 아니라 heterogeneous evidence를 이용하여 복수 전략제약을 동시에 만족하는 reasoning으로 정의하는 것이 더 적절하다.

SciMIF: Understanding Multimodal Instruction Following in Scientific Domains

같은 날 공개된 OmniPhys도 15,246개 문제와 19,850개 이미지를 이용하여 이해뿐 아니라 과학적 diagram 생성까지 평가한다. 이는 scientific multimodal benchmark가 단순 image-question answering에서 reasoning artifact generation으로 확장되는 흐름을 보여준다. (arXiv)

Part VI · Vision & Agenda

이번 점검에서 연구방향을 가장 크게 수정해야 하는 부분

현재까지의 흐름을 합치면, 가장 강한 Vision Paper의 중심 메시지를 조금 바꾸는 것이 좋다.

기존의 핵심 문장:

From AI Co-Scientists to AI Co-Strategists

보다 한 단계 발전시켜

From Hypothesis-Generating Co-Scientists to Execution-Grounded Institutional Co-Strategists

로 가져가는 것을 권한다.

그리고 시스템 구조도

Agentic RAG + HRKG + AQP + Omni-Modal Reasoning

에서 끝내지 않고,

Agentic RAG → Evidence-Sufficiency Controller → Hyper-Relational Obligation Graph → Approximate-to-Exact Evidence Processing → Omni-Modal Verification → Portfolio Optimizer → Execution Monitor → Continual Strategy Revision

으로 정의하는 편이 현재 연구추세를 훨씬 잘 반영한다.

현재 가장 유망해진 네 개의 탑티어 연구주제

우선순위연구주제이번 신규 동향이 강화한 이유
1Execution-Grounded Mission-to-Portfolio IntelligenceCo-Scientist가 실제 실행·검증 폐루프로 이동
2Belief-Calibrated Approximate Evidence RAGMetaRAG의 evidence sufficiency + AQP의 error-bounded execution 결합 가능
3Hyper-Relational Mission Obligation GraphEureka의 obligation graph를 기관 전략기획으로 확장 가능
4Constraint-Faithful Omni-Modal InstPlanBenchSciMIF가 scientific correctness와 instruction adherence의 분리를 보여줌

특히 2번은 SIGMOD/VLDB형 core research paper로, 1번과 3번을 통합한 방향은 Vision/Position/Perspective Paper로 가장 강해 보인다.

이번 검색에서는 2026년 8월 마지막 주에 Hyper-Relational KG 자체의 표현학습이나 일반적인 research-portfolio optimization/KPI synthesis에서 위 논문들과 동급으로 방향을 바꿀 만큼 강한 신규 발표는 확인하지 못했다. 오히려 이것이 연구기회다. 최신 HRKG 연구는 여전히 completion/link prediction 중심이고, 최신 autonomous-science 연구는 hypothesis·experiment 중심이다. 두 흐름 사이의 “institution-level mission–portfolio–KPI–execution reasoning” 영역은 여전히 비어 있다. HyperRAG처럼 n-ary/hypergraph를 RAG에 연결하는 연구는 이미 등장했지만, 이를 기관 전략·KPI·사업화·시간조건을 갖는 qualifier-rich decision graph로 사용하는 연구는 아직 뚜렷하지 않다. (arXiv)

따라서 현재 시점에서 가장 가치가 높은 한 문장의 연구명제는 다음과 같이 갱신할 수 있다.

미래의 출연연 AI 연구기획 시스템은 과제를 “제안”하는 AI가 아니라, 국가미션을 검증 가능한 obligation graph로 변환하고, 필요한 증거만 비용·오차 한계 내에서 수집하며, multimodal evidence와 실제 연구수행 결과를 이용해 연구 포트폴리오를 지속적으로 생성·검증·수정하는 Execution-Grounded Institutional Co-Strategist가 되어야 한다.

Primary References

Research signals cited by the source memo

01
Accelerating Scientific Research with Gemini in the Real-World
Source referenced in the research memo
02
MetaRAG: Belief-Action Aligned Policy Optimization for Agentic RAG
Source referenced in the research memo
03
Query-Centric Optimization of AI Workflows via Approximate Query Processing and Proxy Models
Source referenced in the research memo
04
Eureka: Task-Conditioned Meta-Agent Orchestration for Scientific Discovery
Source referenced in the research memo
05
ScienceFlow: A long-horizon agent for ML research, scientific discovery and beyond
Source referenced in the research memo
06
SciMIF: Understanding Multimodal Instruction Following in Scientific Domains
Source referenced in the research memo
07
OmniPhys: A Unified Multimodal Benchmark for Physics Understanding and Generation from Chinese Educational Corpora
Source referenced in the research memo
08
HyperRAG: Reasoning N-ary Facts over Hypergraphs for Retrieval Augmented Generation
Source referenced in the research memo

The article treats the attached research memo as its primary source. Several cited works are described there as recent preprints; conclusions about institutional R&D planning are explicitly framed as research extensions rather than results directly demonstrated by those papers.