◆ AI CO-STRATEGIST / R&D PLANNING
RESEARCH WATCH · SOURCE DATE 2026-10-05

연구 아이디어를
검증 가능한
기관 포트폴리오로

AI Co-Strategist Research Watch: Evidence, Budgets, and Mission-to-Portfolio Planning

AIM, EvoDuet, Cogentic, OSWorld-Science, ScholarEvolve의 연구 결과를 기관의 미션·증거·예산·사업 포트폴리오 기획으로 확장한다.미션과 아이디어 · 검색·검증 원장 · 실행 평가·진화의 관계를 연결한 해석적 개념도. 실측 자료가 아닌 해석적 구조다.미션과 아이디어01 / EVIDENCE검색·검증 원장02 / REASONING실행 평가·진화03 / VALIDATIONNEW EVIDENCE / REVISION
핵심 연구축과 증거 환류를 연결한 개념도 · 제안과 실증의 구분은 각 절을 따른다.
RESEARCH QUESTION

AIM, EvoDuet, Cogentic, OSWorld-Science, ScholarEvolve의 연구 결과를 기관의 미션·증거·예산·사업 포트폴리오 기획으로 확장한다.

조사 기록과 근거 수준

게시 기준일: 2026-10-05. 본문의 점검 기간인 2026년 9월 29일~10월 5일의 마지막 날을 게시 기준일로 사용한다. 원문에 명시된 개별 발표일과 검색 기간은 본문에 보존했다. 각 논문의 실험 결과와 출연연 적용 제안을 구분한다. Verified Hyper-Relational Strategic Ledger, InstPlan-ExecBench, Lifelong Institutional Co-Strategist는 본문의 제안이며 검증된 제품이나 벤치마크가 아니다.

PART 01

AIM · 아이디어와 예산의 배분

지난 점검 이후인 2026년 9월 29일~10월 5일 사이에는 알릴 가치가 있는 변화가 확인됐다. 이번 주의 핵심은 “AI가 좋은 연구아이디어를 생성하는가”에서 “아이디어 포트폴리오를 관리하고, 필요한 증거검색을 스스로 변화시키며, 검증된 중간결과만 축적하고, 실제 산출물로 성과를 평가하는가”로 연구 초점이 이동했다는 것이다. 특히 출연연의 목표형상 → 핵심기술 → KPI → 전략사업 → 사업화를 자율적으로 구성하는 AI Co-Strategist와 직접 연결되는 신규 연구가 나왔다.

1. 가장 직접적인 변화 — AIM이 “연구 아이디어 관리” 자체를 자율연구의 핵심문제로 만들었다

9월 29일 공개된 AIM: Agentic Idea Management for Automated Research는 이번 점검에서 가장 중요한 논문이다. 기존 autonomous research가 하나의 문제에 대한 solution search에 집중했다면, AIM은 idea-driven search를 별도 문제로 정의하고, ① 진화하는 연구아이디어의 조직, ② 유망 방향의 선택, ③ 아이디어와 실제 구현 간 정합성 유지라는 세 문제를 명시적으로 다룹니다. 이를 위해 Bayesian optimization에서 착안한 Agentic Surrogate + Agentic Acquisition, 아이디어와 구현의 일치를 검사하는 Solution Auditor, 남은 실험예산을 여러 연구방향에 동적으로 배분하는 Resource Planner를 사용한다. 10개 AutoLab 과제에서 장기 Model Development/CUDA 과제의 strongest baseline보다 4.9%p 높았고, 동일 baseline 성능에 최대 3.1배 빠르게 도달했다고 보고한다. 현재는 arXiv preprint이다. arXiv

AIM 논문

이것은 지속적으로 추적해 온 Mission-to-Portfolio Planning과 거의 바로 연결된다. 출연연에서 필요한 것은 연구주제 하나의 최적화가 아니라,

National Mission → Candidate Research Ideas → Research Directions → Strategic Programs → Portfolio

의 탐색이기 때문이다.

따라서 기존 PORTIA / Mission-to-Portfolio Intelligence를 이제 Agentic Mission Portfolio Manager로 구체화할 수 있다. AIM의 acquisition function을 단순 예상 실험성능이 아니라

\[ A(p)= f(\text{Mission Fit}, \text{Institutional Advantage}, \text{Novelty}, \text{KPI Feasibility}, \text{Translation Potential}, \text{Uncertainty}, \text{Cost}) \]

로 확장하는 것이다.

특히 이것은 AQP와의 연결을 훨씬 자연스럽게 만든다. 수천 개 후보 전략사업을 모두 정밀평가하지 않고, acquisition score와 uncertainty를 이용하여 일부 후보만 exact evaluation하는 Approximate-to-Exact Portfolio Search가 명확한 신규 DB 연구문제가 됩니다.


PART 02

EvoDuet · 검색과 해법의 공동 진화

2. EvoDuet — 검색질의와 연구해법이 함께 진화해야 한다는 새로운 Agentic RAG 방향

9월 30일 공개된 EvoDuet: Bilevel Co-Evolution of Web Searching and Task Solving for Scientific Discovery는 과학적 Agentic RAG 측면에서 중요한다. 일반적인 연구 agent는 처음 정한 검색질의를 반복하거나 solution이 바뀌어도 비슷한 문서를 계속 가져오는 문제가 있다. EvoDuet은 solution과 search query를 함께 진화시키는 bi-level optimization을 제안한다. Retrieval Gate가 현재 knowledge gap을 판단하여 새 자료 검색, 기존 자료 재사용, 검색 없이 진행 중 하나를 선택하고, inner loop는 검색질의와 문서순위를 수정하며, outer loop는 해당 자료를 이용하여 여러 해법을 생성·평가한다. 21개 최적화 과제에서 모델에 따라 상당한 discovery gain 향상을 보고했고, 일부 과제에서는 기존 최고 기록을 넘어섰다. arXiv

EvoDuet 논문

출연연 전략기획의 의미는 매우 큽니다. 지금까지 Agentic RAG를

질문 → 증거검색 → 연구사업 생성

으로 생각했다면 앞으로는

현재 Portfolio State
↕
Search Strategy
↕
Evidence
↕
Candidate Portfolio

가 동시에 진화해야 한다.

예를 들어 초기에는 “Physical AI world model” 관련 자료를 검색했더라도, 분석 도중 ETRI의 비교우위가 world model 자체보다 distributed cooperative intelligence에 있다는 증거가 나타나면 이후 검색질의도 자동으로 그 방향으로 재구성되어야 한다.

따라서 새로운 연구주제로는

Co-Evolving Strategic Retrieval and Portfolio Search for Mission-Driven R&D Planning

이 상당히 강해졌다.

AQP의 역할 역시 “검색비용 절감”에서 한 단계 발전한다.

현재 포트폴리오 선택을 가장 크게 바꿀 가능성이 있는 evidence query만 실행한다.

즉 Value-of-Evidence-aware AQP로 정의할 수 있다.


PART 03

Cogentic · 검증된 전략 근거 원장

3. Cogentic — 자율과학에서 “Persistent Verified Ledger”가 핵심 아키텍처로 등장

같은 9월 30일 공개된 Cogentic: Multi-Agent Orchestration for Automated Proof Discovery도 중요한 변화이다. Cogentic은 여러 prover가 서로 다른 연구방향을 탐색하고, specialized verifier가 adversarial verification을 수행한 뒤, 검증된 중간 결과만 persistent verified ledger에 승격하여 다음 탐색에서 재사용한다. 저자들은 Gemini 기반 시스템으로 online learning, auction theory, mechanism design 분야의 다섯 개 open problem에서 새로운 결과를 얻었으며 각각 도메인 전문가의 독립 검증을 받았다고 보고한다. 역시 현재는 preprint이다. arXiv

Cogentic 논문

이것은 Hyper-Relational Graph를 출연연 AI 연구기획에 적용할 때 매우 중요한 힌트를 준다.

기관의 전략지식 그래프에는 검색된 모든 주장을 동일하게 저장하는 것이 아니라,

Candidate Claim → Verification → Verified Strategic Ledger

라는 상태전이가 필요한다.

예를 들어

“기술 X는 2030년 ETRI가 선도할 전략 핵심기술이다.”

라는 주장을 graph에 바로 확정 사실로 넣지 않고,

01 claim
02 evidence
03 counter-evidence
04 source
05 source-date
06 target-year
07 institutional-role
08 baseline
09 assumptions
10 KPI
11 confidence
12 verification-status

를 가진 hyper-relational object로 저장한다.

그리고 독립 verifier를 통과한 경우에만 Verified Strategic Ledger로 승격한다.

따라서 이전에 제안한 Agent-Built Institutional Epistemic Graph는 이제

Verified Hyper-Relational Strategic Ledger

로 발전시키는 것이 더 강한다.

HRKG가 단순 knowledge representation을 넘어 기관 의사결정에서 어떤 주장을 실제 투자판단에 사용할 수 있는지를 관리하는 epistemic control plane이 되는 것이다.


PART 04

OSWorld-Science · 산출물로 평가하기

4. OSWorld-Science — 과학 Agent 평가가 “좋은 답변”에서 “실제로 남긴 검증 가능한 산출물” 평가로 이동

9월 30일 공개된 OSWorld-Science는 Omni-Modal Scientific Reasoning과 benchmark 관점에서 의미가 큽니다. 이 benchmark는 12개 VLM을 대상으로 146개의 실제 scientific software workflow를 평가하며, 분자구조·역합성, 병리영상, 통계분석, 물리 simulation 등 다양한 과제를 포함한다. 가장 중요한 부분은 답변 텍스트를 평가하는 것이 아니라 application state와 실제 생성 artifact—분자구조, segmentation mask, plot, numerical result—를 execution-based evaluator가 직접 검사한다는 점이다. arXiv

OSWorld-Science 논문

출연연용 InstPlanBench 역시 이 방향으로 바꿀 필요가 있다.

현재 일반적인 연구기획 평가는 AI가 만든 보고서의 plausibility를 평가하기 쉽다. 그러나 진짜 AI Co-Strategist benchmark는

“좋은 문서를 만들었는가?”

가 아니라

“기획 결과가 실제 실행 가능한 전략상태를 만들었는가?”

를 평가해야 한다.

따라서 산출물을 다음처럼 executable artifact로 정의하는 것이 좋다.

Target-State Graph + Technology Dependency Graph + KPI Contract + Resource Allocation + Risk Register + Commercialization Path + Stop/Pivot Conditions

그리고 simulator 또는 historical backtesting environment에서 실제로

  • KPI가 측정 가능한가,
  • 기술 dependency가 충족되는가,
  • 예산 안에서 수행 가능한가,
  • 중복 사업을 만들지 않았는가,
  • 새로운 evidence가 들어오면 올바르게 pivot하는가

를 자동 검사해야 한다.

이 방향은 새로운 benchmark인

InstPlan-ExecBench: Execution-Based Evaluation of Autonomous Institutional R&D Planning

으로 발전시킬 가치가 높다.


PART 05

ScholarEvolve · 기획 하네스의 진화

5. ScholarEvolve — 기술동향을 읽는 것에서 “새 연구를 이용해 AI 기획시스템 자체를 진화”시키는 단계로 확장

9월 30일 공개된 Learning from Research: Toward Lifelong Agent Harness Evolution은 technology foresight 관점에서 주목할 만한다. ScholarEvolve는 agent가 실패를 보고 수동적으로 자신을 수정하는 대신, 최신 연구논문을 지속적으로 읽고 그 연구에서 새로운 harness 개선전략을 추출하여 agent architecture 자체를 진화시킵니다. 새 논문을 계속 받아들이도록 설계되어 있다는 점이 특히 중요한다. AppWorld와 Tau2-Bench에서 의미 있는 성능개선을 보고한다. arXiv

ScholarEvolve 논문

이것은 출연연 technology foresight의 역할을 바꿀 수 있다.

기존:

새 연구동향 → 보고서 업데이트

향후:

새 연구동향 → 기획 Agent의 검색·평가·검증 전략 자체 업데이트

이다.

즉 AI Co-Strategist는 최신 정보를 아는 것뿐 아니라, 최신 연구방법을 보고 자신이 기획하는 방법까지 바꾸는 시스템이 됩니다.

이를

Lifelong Institutional Co-Strategist

라는 연구문제로 정의할 수 있다.


PART 06

통합 아키텍처와 연구 우선순위

이번 주 결과가 바꾸는 전체 연구 아키텍처

이번 신규 연구들을 반영하면 가장 강한 구조는 이제 다음과 같다.

National Mission
→ Mission Epistemic State
→ Agentic Idea Manager
→ Approximate Candidate Portfolio Search
→ Co-Evolving Evidence Retrieval
→ Hyper-Relational Strategic Ledger
→ Portfolio / KPI / Translation Synthesis
→ Independent Verification
→ Execution-Based Evaluation
→ Human Authorization
→ Outcome Feedback
→ Lifelong Harness Evolution

여기에서 네 핵심기술의 역할도 훨씬 선명해졌다.

기술 이제 가장 설득력 있는 역할
Agentic RAG 포트폴리오 변화에 맞춰 search strategy 자체를 동적으로 진화
Hyper-Relational Graph 조건·시점·근거·반증·검증상태를 포함한 Verified Strategic Ledger
AQP 수많은 아이디어·증거 중 투자판단을 바꿀 가능성이 높은 것만 정밀평가
Omni-Modal Scientific Reasoning 텍스트뿐 아니라 표·그래프·시뮬레이션·코드·KPI·실제 산출물까지 통합 검증

현재 연구주제 우선순위도 조정할 가치가 있다

이번 주 이후에는 1순위를 Agentic Mission Portfolio Management under Evidence and Budget Constraints, 2순위를 Verified Hyper-Relational Strategic Ledger for Institutional Co-Strategists, 3순위를 Value-of-Evidence Approximate Query Processing for Autonomous R&D Planning, 4순위를 InstPlan-ExecBench, 5순위를 Lifelong Co-Strategist via Research-Driven Harness Evolution으로 두는 것이 좋다.

특히 AIM + EvoDuet + Cogentic의 결합은 상당히 중요한 신호이다. 서로 독립적으로 발표된 최신 연구들이 공통적으로 아이디어 공간 관리 → 능동적 증거획득 → 검증된 지식 축적이라는 구조로 수렴하고 있다. 아직 이 세 요소를 국가미션–기관역량–목표형상–핵심기술–KPI–사업화 포트폴리오 문제에 통합한 연구는 확인되지 않았다.

따라서 현 시점에서 가장 강한 신규 연구공백은 다음 한 문장으로 정리할 수 있다.

“AI가 연구아이디어를 만드는 문제”는 빠르게 채워지고 있지만, 수많은 연구아이디어를 국가미션과 기관 비교우위 아래에서 포트폴리오로 조직하고, 필요한 증거를 비용제약하에 능동적으로 획득하며, 검증된 주장만 기관의 전략지식으로 승격하고, 실제 수행결과에 따라 포트폴리오를 지속적으로 수정하는 AI Co-Strategist 문제는 여전히 비어 있다.

이번 검색에서는 9월 29일 이후 Hyper-Relational KG representation/completion 자체, 전통적인 AQP 자체, KPI synthesis만을 직접 다루는 신규 탑티어 main-track 결과는 확인하지 못했다. 그러나 오히려 위 신규 연구들 때문에 이 기술들을 institution-level autonomous research planning으로 결합할 학술적 근거가 지난 점검 때보다 훨씬 강해졌다.

SOURCE RECORD

자료와 출처

구성 자료: Research-Planning-1005.md. 첨부의 모든 연구 항목, 비교, 수치, 표, 수식, 한계와 후속 연구 제안을 수록했다. 대화 시스템의 인용 표시와 추적 매개변수는 편집 과정에서 제거했다. 읽기용 본문 외에 첨부 원문도 아래에 보존한다. 본문 링크는 해당 자료로 연결된다.

  1. arXivarxiv.org · PRIMARY SOURCE / RESEARCH RESOURCE
  2. arXivarxiv.org · PRIMARY SOURCE / RESEARCH RESOURCE
  3. arXivarxiv.org · PRIMARY SOURCE / RESEARCH RESOURCE
  4. arXivarxiv.org · PRIMARY SOURCE / RESEARCH RESOURCE
  5. arXivarxiv.org · PRIMARY SOURCE / RESEARCH RESOURCE
첨부 원문 전체 보기 · Research-Planning-1005.md
지난 점검 이후인 **2026년 9월 29일~10월 5일** 사이에는 알릴 가치가 있는 변화가 확인됐습니다. 이번 주의 핵심은 **“AI가 좋은 연구아이디어를 생성하는가”에서 “아이디어 포트폴리오를 관리하고, 필요한 증거검색을 스스로 변화시키며, 검증된 중간결과만 축적하고, 실제 산출물로 성과를 평가하는가”로 연구 초점이 이동했다는 것**입니다. 특히 출연연의 `목표형상 → 핵심기술 → KPI → 전략사업 → 사업화`를 자율적으로 구성하는 AI Co-Strategist와 직접 연결되는 신규 연구가 나왔습니다.

### 1. 가장 직접적인 변화 — AIM이 “연구 아이디어 관리” 자체를 자율연구의 핵심문제로 만들었다

9월 29일 공개된 **AIM: Agentic Idea Management for Automated Research**는 이번 점검에서 가장 중요한 논문입니다. 기존 autonomous research가 하나의 문제에 대한 solution search에 집중했다면, AIM은 **idea-driven search**를 별도 문제로 정의하고, ① 진화하는 연구아이디어의 조직, ② 유망 방향의 선택, ③ 아이디어와 실제 구현 간 정합성 유지라는 세 문제를 명시적으로 다룹니다. 이를 위해 Bayesian optimization에서 착안한 **Agentic Surrogate + Agentic Acquisition**, 아이디어와 구현의 일치를 검사하는 **Solution Auditor**, 남은 실험예산을 여러 연구방향에 동적으로 배분하는 **Resource Planner**를 사용합니다. 10개 AutoLab 과제에서 장기 Model Development/CUDA 과제의 strongest baseline보다 4.9%p 높았고, 동일 baseline 성능에 최대 3.1배 빠르게 도달했다고 보고합니다. 현재는 arXiv preprint입니다. [arXiv](https://arxiv.org/abs/2609.38445)

[AIM 논문](https://arxiv.org/abs/2609.38445?utm_source=chatgpt.com)

이것은 우리가 계속 추적해 온 **Mission-to-Portfolio Planning**과 거의 바로 연결됩니다. 출연연에서 필요한 것은 연구주제 하나의 최적화가 아니라,

**National Mission → Candidate Research Ideas → Research Directions → Strategic Programs → Portfolio**

의 탐색이기 때문입니다.

따라서 기존 `PORTIA / Mission-to-Portfolio Intelligence`를 이제 **Agentic Mission Portfolio Manager**로 구체화할 수 있습니다. AIM의 acquisition function을 단순 예상 실험성능이 아니라

\[
A(p)=
f(\text{Mission Fit},
\text{Institutional Advantage},
\text{Novelty},
\text{KPI Feasibility},
\text{Translation Potential},
\text{Uncertainty},
\text{Cost})
\]

로 확장하는 것입니다.

특히 이것은 **AQP와의 연결을 훨씬 자연스럽게 만듭니다.** 수천 개 후보 전략사업을 모두 정밀평가하지 않고, acquisition score와 uncertainty를 이용하여 일부 후보만 exact evaluation하는 **Approximate-to-Exact Portfolio Search**가 명확한 신규 DB 연구문제가 됩니다.

---

### 2. EvoDuet — 검색질의와 연구해법이 함께 진화해야 한다는 새로운 Agentic RAG 방향

9월 30일 공개된 **EvoDuet: Bilevel Co-Evolution of Web Searching and Task Solving for Scientific Discovery**는 과학적 Agentic RAG 측면에서 중요합니다. 일반적인 연구 agent는 처음 정한 검색질의를 반복하거나 solution이 바뀌어도 비슷한 문서를 계속 가져오는 문제가 있습니다. EvoDuet은 **solution과 search query를 함께 진화시키는 bi-level optimization**을 제안합니다. Retrieval Gate가 현재 knowledge gap을 판단하여 새 자료 검색, 기존 자료 재사용, 검색 없이 진행 중 하나를 선택하고, inner loop는 검색질의와 문서순위를 수정하며, outer loop는 해당 자료를 이용하여 여러 해법을 생성·평가합니다. 21개 최적화 과제에서 모델에 따라 상당한 discovery gain 향상을 보고했고, 일부 과제에서는 기존 최고 기록을 넘어섰습니다. [arXiv](https://arxiv.org/abs/2609.40340)

[EvoDuet 논문](https://arxiv.org/abs/2609.40340?utm_source=chatgpt.com)

출연연 전략기획의 의미는 매우 큽니다. 지금까지 Agentic RAG를

**질문 → 증거검색 → 연구사업 생성**

으로 생각했다면 앞으로는

**현재 Portfolio State  
↕  
Search Strategy  
↕  
Evidence  
↕  
Candidate Portfolio**

가 **동시에 진화**해야 합니다.

예를 들어 초기에는 “Physical AI world model” 관련 자료를 검색했더라도, 분석 도중 ETRI의 비교우위가 world model 자체보다 **distributed cooperative intelligence**에 있다는 증거가 나타나면 이후 검색질의도 자동으로 그 방향으로 재구성되어야 합니다.

따라서 새로운 연구주제로는

**Co-Evolving Strategic Retrieval and Portfolio Search for Mission-Driven R&D Planning**

이 상당히 강해졌습니다.

AQP의 역할 역시 “검색비용 절감”에서 한 단계 발전합니다.

> **현재 포트폴리오 선택을 가장 크게 바꿀 가능성이 있는 evidence query만 실행한다.**

즉 **Value-of-Evidence-aware AQP**로 정의할 수 있습니다.

---

### 3. Cogentic — 자율과학에서 “Persistent Verified Ledger”가 핵심 아키텍처로 등장

같은 9월 30일 공개된 **Cogentic: Multi-Agent Orchestration for Automated Proof Discovery**도 중요한 변화입니다. Cogentic은 여러 prover가 서로 다른 연구방향을 탐색하고, specialized verifier가 adversarial verification을 수행한 뒤, **검증된 중간 결과만 persistent verified ledger에 승격**하여 다음 탐색에서 재사용합니다. 저자들은 Gemini 기반 시스템으로 online learning, auction theory, mechanism design 분야의 다섯 개 open problem에서 새로운 결과를 얻었으며 각각 도메인 전문가의 독립 검증을 받았다고 보고합니다. 역시 현재는 preprint입니다. [arXiv](https://arxiv.org/abs/2609.40324)

[Cogentic 논문](https://arxiv.org/abs/2609.40324?utm_source=chatgpt.com)

이것은 Hyper-Relational Graph를 출연연 AI 연구기획에 적용할 때 매우 중요한 힌트를 줍니다.

기관의 전략지식 그래프에는 검색된 모든 주장을 동일하게 저장하는 것이 아니라,

**Candidate Claim → Verification → Verified Strategic Ledger**

라는 상태전이가 필요합니다.

예를 들어

> “기술 X는 2030년 ETRI가 선도할 전략 핵심기술이다.”

라는 주장을 graph에 바로 확정 사실로 넣지 않고,

```text
claim
 ├ evidence
 ├ counter-evidence
 ├ source
 ├ source-date
 ├ target-year
 ├ institutional-role
 ├ baseline
 ├ assumptions
 ├ KPI
 ├ confidence
 └ verification-status
```

를 가진 hyper-relational object로 저장합니다.

그리고 독립 verifier를 통과한 경우에만 **Verified Strategic Ledger**로 승격합니다.

따라서 이전에 제안한 **Agent-Built Institutional Epistemic Graph**는 이제

### **Verified Hyper-Relational Strategic Ledger**

로 발전시키는 것이 더 강합니다.

HRKG가 단순 knowledge representation을 넘어 **기관 의사결정에서 어떤 주장을 실제 투자판단에 사용할 수 있는지를 관리하는 epistemic control plane**이 되는 것입니다.

---

### 4. OSWorld-Science — 과학 Agent 평가가 “좋은 답변”에서 “실제로 남긴 검증 가능한 산출물” 평가로 이동

9월 30일 공개된 **OSWorld-Science**는 Omni-Modal Scientific Reasoning과 benchmark 관점에서 의미가 큽니다. 이 benchmark는 12개 VLM을 대상으로 **146개의 실제 scientific software workflow**를 평가하며, 분자구조·역합성, 병리영상, 통계분석, 물리 simulation 등 다양한 과제를 포함합니다. 가장 중요한 부분은 답변 텍스트를 평가하는 것이 아니라 **application state와 실제 생성 artifact—분자구조, segmentation mask, plot, numerical result—를 execution-based evaluator가 직접 검사**한다는 점입니다. [arXiv](https://arxiv.org/abs/2609.39903)

[OSWorld-Science 논문](https://arxiv.org/abs/2609.39903?utm_source=chatgpt.com)

출연연용 `InstPlanBench` 역시 이 방향으로 바꿀 필요가 있습니다.

현재 일반적인 연구기획 평가는 AI가 만든 보고서의 plausibility를 평가하기 쉽습니다. 그러나 진짜 AI Co-Strategist benchmark는

**“좋은 문서를 만들었는가?”**

가 아니라

**“기획 결과가 실제 실행 가능한 전략상태를 만들었는가?”**

를 평가해야 합니다.

따라서 산출물을 다음처럼 executable artifact로 정의하는 것이 좋습니다.

**Target-State Graph + Technology Dependency Graph + KPI Contract + Resource Allocation + Risk Register + Commercialization Path + Stop/Pivot Conditions**

그리고 simulator 또는 historical backtesting environment에서 실제로

- KPI가 측정 가능한가,
- 기술 dependency가 충족되는가,
- 예산 안에서 수행 가능한가,
- 중복 사업을 만들지 않았는가,
- 새로운 evidence가 들어오면 올바르게 pivot하는가

를 자동 검사해야 합니다.

이 방향은 새로운 benchmark인

### **InstPlan-ExecBench: Execution-Based Evaluation of Autonomous Institutional R&D Planning**

으로 발전시킬 가치가 높습니다.

---

### 5. ScholarEvolve — 기술동향을 읽는 것에서 “새 연구를 이용해 AI 기획시스템 자체를 진화”시키는 단계로 확장

9월 30일 공개된 **Learning from Research: Toward Lifelong Agent Harness Evolution**은 technology foresight 관점에서 주목할 만합니다. ScholarEvolve는 agent가 실패를 보고 수동적으로 자신을 수정하는 대신, **최신 연구논문을 지속적으로 읽고 그 연구에서 새로운 harness 개선전략을 추출하여 agent architecture 자체를 진화**시킵니다. 새 논문을 계속 받아들이도록 설계되어 있다는 점이 특히 중요합니다. AppWorld와 Tau2-Bench에서 의미 있는 성능개선을 보고합니다. [arXiv](https://arxiv.org/abs/2609.40169)

[ScholarEvolve 논문](https://arxiv.org/abs/2609.40169?utm_source=chatgpt.com)

이것은 출연연 technology foresight의 역할을 바꿀 수 있습니다.

기존:

**새 연구동향 → 보고서 업데이트**

향후:

**새 연구동향 → 기획 Agent의 검색·평가·검증 전략 자체 업데이트**

입니다.

즉 AI Co-Strategist는 최신 정보를 **아는 것**뿐 아니라, 최신 연구방법을 보고 **자신이 기획하는 방법까지 바꾸는 시스템**이 됩니다.

이를

### **Lifelong Institutional Co-Strategist**

라는 연구문제로 정의할 수 있습니다.

---

## 이번 주 결과가 바꾸는 전체 연구 아키텍처

이번 신규 연구들을 반영하면 가장 강한 구조는 이제 다음과 같습니다.

**National Mission**  
→ **Mission Epistemic State**  
→ **Agentic Idea Manager**  
→ **Approximate Candidate Portfolio Search**  
→ **Co-Evolving Evidence Retrieval**  
→ **Hyper-Relational Strategic Ledger**  
→ **Portfolio / KPI / Translation Synthesis**  
→ **Independent Verification**  
→ **Execution-Based Evaluation**  
→ **Human Authorization**  
→ **Outcome Feedback**  
→ **Lifelong Harness Evolution**

여기에서 네 핵심기술의 역할도 훨씬 선명해졌습니다.

| 기술 | 이제 가장 설득력 있는 역할 |
|---|---|
| **Agentic RAG** | 포트폴리오 변화에 맞춰 search strategy 자체를 동적으로 진화 |
| **Hyper-Relational Graph** | 조건·시점·근거·반증·검증상태를 포함한 **Verified Strategic Ledger** |
| **AQP** | 수많은 아이디어·증거 중 투자판단을 바꿀 가능성이 높은 것만 정밀평가 |
| **Omni-Modal Scientific Reasoning** | 텍스트뿐 아니라 표·그래프·시뮬레이션·코드·KPI·실제 산출물까지 통합 검증 |

### 현재 연구주제 우선순위도 조정할 가치가 있습니다

이번 주 이후에는 **1순위**를 **Agentic Mission Portfolio Management under Evidence and Budget Constraints**, **2순위**를 **Verified Hyper-Relational Strategic Ledger for Institutional Co-Strategists**, **3순위**를 **Value-of-Evidence Approximate Query Processing for Autonomous R&D Planning**, **4순위**를 **InstPlan-ExecBench**, **5순위**를 **Lifelong Co-Strategist via Research-Driven Harness Evolution**으로 두는 것이 좋습니다.

특히 **AIM + EvoDuet + Cogentic**의 결합은 상당히 중요한 신호입니다. 서로 독립적으로 발표된 최신 연구들이 공통적으로 **아이디어 공간 관리 → 능동적 증거획득 → 검증된 지식 축적**이라는 구조로 수렴하고 있습니다. 아직 이 세 요소를 **국가미션–기관역량–목표형상–핵심기술–KPI–사업화 포트폴리오** 문제에 통합한 연구는 확인되지 않았습니다.

따라서 현 시점에서 가장 강한 신규 연구공백은 다음 한 문장으로 정리할 수 있습니다.

> **“AI가 연구아이디어를 만드는 문제”는 빠르게 채워지고 있지만, 수많은 연구아이디어를 국가미션과 기관 비교우위 아래에서 포트폴리오로 조직하고, 필요한 증거를 비용제약하에 능동적으로 획득하며, 검증된 주장만 기관의 전략지식으로 승격하고, 실제 수행결과에 따라 포트폴리오를 지속적으로 수정하는 AI Co-Strategist 문제는 여전히 비어 있다.**

이번 검색에서는 **9월 29일 이후 Hyper-Relational KG representation/completion 자체, 전통적인 AQP 자체, KPI synthesis만을 직접 다루는 신규 탑티어 main-track 결과는 확인하지 못했습니다.** 그러나 오히려 위 신규 연구들 때문에 이 기술들을 **institution-level autonomous research planning**으로 결합할 학술적 근거가 지난 점검 때보다 훨씬 강해졌습니다.