SUNGSOO'S AI BLOGNATIONAL MISSION · 2026.09.28
MISSION INTELLIGENCE · RESEARCH LINEAGE · EVIDENCE FIREWALL

연구과제 생성에서
연구투자 수정으로

Continual Mission-to-Portfolio Intelligence: Evidence-Governed AI Co-Strategists

AI가 기획서를 한 번 만드는 것으로는 충분하지 않다. 후보를 비용·오차 제약 아래 좁히고, 실험의 계보와 증거를 보존하며, 독립 검증을 거쳐 다음 투자를 다시 선택해야 한다.

BRIEFING UPDATE & PUBLICATION DATE · 2026-09-28

국가미션에서 연구투자 수정으로 이어지는 근거 중심 순환 구조미션에서 후보 생성과 압축, 연구 계보, 독립 검증을 거쳐 인간 승인으로 이어지고 실행 결과가 다음 질문과 포트폴리오 수정으로 되돌아가는 개념도. 이것은 첨부의 통합 연구 제안이지 실측 결과가 아니다.A PROPOSED INSTITUTIONAL RESEARCH LOOP · NOT AN EMPIRICAL PIPELINEMISSIONFUNNELLINEAGEVERIFY국가임무후보 압축실험 계보독립 검증목표 · 제약비용 · 오차성과 · 근거원자료 · 감사인간 승인 · 실행 · 진단다음 질문과 포트폴리오 수정
연구 결과 다섯 갈래를 기관의 순환적 의사결정으로 엮은 개념도. 각 논문의 검증 결과와는 별개다.
EDITORIAL ABSTRACT

9월 23–24일 공개된 다섯 갈래 자료는 장기 연구행동, 후보 압축, 요약 상태, 검증자 오염과 로그 무결성, 실제 개선 평가라는 서로 다른 문제를 비춘다. 이 글은 이를 출연연 AI Co-Strategist의 지속적 Mission-to-Portfolio Intelligence로 연결하되, 원연구가 보인 결과와 새로운 설계 가설을 분리한다.

원자료: National-Mission-Trends-0928.md · 업데이트 2026-09-28. 원자료는 기업 발표와 arXiv 사전 공개 연구를 포함한다.

전체 목차
  1. 이번 주 변화: 생성에서 지속적 연구운영으로
  2. AgentX: 실험 계보가 다음 질문을 고른다
  3. Anthropic: 후보 과잉을 압축하는 과학적 판단
  4. IterSynth: 검색 기록이 아닌 진화하는 상태
  5. Evidence Firewall: 검증자의 시야와 로그의 무결성
  6. SWE-Prometheus: 문서가 아니라 실제 개선
  7. 미션에서 투자 수정까지 이어지는 아키텍처
PART 01 / RESEARCH UPDATE

이번 주 변화: 생성에서 지속적 연구운영으로

2026년 9월 28일 점검에서는 지난 점검 이후 연구방향을 실제로 수정할 만한 변화가 확인됐다. 이번 주의 핵심은 “AI가 연구과제를 잘 제안하는가?”에서 한 단계 더 나아가, AI가 장기간 연구 프로그램을 운영하고 다음 연구질문을 선택하며, 대규모 후보를 단계적으로 압축하고, 그 과정 자체를 독립적으로 검증·감사할 수 있는가로 초점이 이동했다는 점이다. 다만 아래 결과 중 다수는 아직 arXiv preprint 또는 기업 기술보고서이므로 peer-reviewed 확정 결과와는 구분해서 볼 필요가 있다.

게시일은 이 브리핑의 업데이트 기준일인 2026년 9월 28일이다. 아래의 9월 23–24일은 각 원자료의 발표·제출 날짜다. 기업 발표와 arXiv 사전 공개본은 동료심사 확정 결과와 구분한다.

PART 02 / CONTINUAL PROGRAMS

AgentX: 실험 계보가 다음 질문을 고른다

이번 점검 · 출연연 AI Co-Strategist와 직접 연결되는 연구

9월 24일 공개된 Advancing Model Research in AgentX: Long-Horizon Autonomy for Industrial Recommender Systems는 매우 중요하다. AgentX-Model은 Research Agent와 Model Agent를 분리하고, 한 실험의 결과가 다음 연구질문을 결정하도록 장기간 연구를 연결한다. Research Agent는 논문과 과거 실험으로부터 독립적으로 검토되는 proposal을 만들고, Model Agent는 다회 실험·코드·측정값·미해결 질문을 반환한다. 연구는 이를 Reproduce → Follow-up → Composition → Diagnose라는 네 가지 연구행동으로 조직한다. 실제 production 평가에서는 모델을 변경한 완료 실험 636건 중 560건이 각 business baseline보다 높은 AUC를 기록했다고 보고한다. 근거 · AgentX-Model 원문

이것은 앞서 구상한 Mission-to-Portfolio Intelligence에 매우 중요한 변화다. 출연연 AI를 “전략사업 제안서 생성기”로 만드는 것보다 다음 구조가 훨씬 강해진다.

Mission → Research Program → Experiment/사업 결과 → Diagnose → 다음 Research Question → Portfolio Revision

즉 AI Co-Strategist가 한 번 포트폴리오를 만드는 시스템이 아니라 연구사업의 lineage를 따라가며 다음 투자를 선택하는 continual program manager가 되어야 한다.

여기서 새로운 연구주제가 나온다.

Research-Lineage Graph for Autonomous Institutional R&D Planning

각 사업을 독립 node가 아니라,

parent program → follow-up → composition → diagnosis → pivot/stop

관계를 가진 Hyper-Relational Research Lineage Graph로 표현하고, 각 edge에 evidence, KPI delta, budget, time, risk, review outcome, commercialization signal을 qualifier로 넣는 것이다.

AgentX-Model 원문

전이의 한계 · 560/636은 산업 추천모델의 완료된 모델 변경 실험에서 각 업무 기준선 대비 AUC를 비교한 결과다. 국가 연구사업의 성과나 예산 효율이 같은 비율로 개선된다는 뜻은 아니다. Research-Lineage Graph는 이 글의 기관 기획 적용 제안이다.

PART 03 / PORTFOLIO FUNNEL

Anthropic: 후보 과잉을 압축하는 과학적 판단

200,000+RT COLLECTION
3,500CANDIDATE SYSTEMS
20HUMAN-READABLE REPORTS
HumanLAB EXPERIMENTS

9월 23일 Anthropic은 Claude agent들이 DNA 데이터에서 새로운 효소계 ART(array-associated reverse transcriptases) 후보를 발견했다고 발표했다. 약 950개의 agent가 21시간 동안 2.1억 token을 사용해 20만 개 이상의 reverse transcriptase를 모으고, 약 3,500개 후보 시스템을 찾은 뒤, 사람이 검토할 20개의 human-readable report로 압축했다. 이후 실제 실험은 인간 연구자가 수행했다. ART의 기능 자체는 아직 밝혀지지 않았으며 연구가 진행 중이다. 근거 · Anthropic 공식 발표

이 사례에서 출연연 연구기획에 더 중요한 부분은 발견 자체보다 200,000 → 3,500 → 20 → 실험이라는 funnel이다.

대규모 Agentic AI 환경에서는 앞으로 아이디어 부족이 아니라 후보 과잉(candidate abundance)이 문제가 될 가능성이 높다. Anthropic도 수백~수천 개의 가설 중 어떤 것이 실험할 가치가 있는지를 구별하는 scientific taste 자체를 연구대상으로 삼고 있다고 설명한다. 근거 · Anthropic 공식 발표

이것은 AQP를 출연연 연구기획에 결합하는 논리를 훨씬 강하게 만든다.

기존:

AQP = 비싼 LLM 호출을 줄이는 기술

보다,

AQP = 수천~수만 개 연구사업 후보 중 최종 전략판단을 바꾸지 않으면서 검토해야 할 후보와 증거를 최소화하는 기술

로 정의하는 것이 더 강하다.

따라서 신규 연구문제로는

Approximate Portfolio Funnel: Error-Bounded Candidate Reduction for Autonomous R&D Planning

을 추천한다.

예를 들어 목표를

\[ P(\text{Top-K portfolio unchanged after exact review}) \ge 1-\delta \]

로 두고, 수천 개 연구주제 후보 중 exact review가 필요한 후보만 단계적으로 남기는 것이다.

이것은 Agentic RAG + AQP + Portfolio Optimization이 자연스럽게 결합되는 검증 가능한 데이터베이스 연구문제다.

Anthropic 공식 발표

검증 단계 · ART의 기능은 아직 밝혀지지 않았다. 후보를 좁힌 뒤의 실험은 인간 연구자가 수행했다. 확률식은 논문이 증명한 보장이 아니라 포트폴리오 후보 축소의 연구 목표다.

PART 04 / STRATEGIC STATE

IterSynth: 검색 기록이 아닌 진화하는 상태

9월 24일 공개된 IterSynth: Rethinking Deep Search Agents via Role-Decoupled Iterative Synthesis는 Agentic RAG 설계 측면에서 의미가 크다. 기존 ReAct형 deep-search agent는 planning, evidence interpretation, synthesis를 하나의 policy가 모두 담당하고 검색이 길어질수록 context가 누적되는 문제가 있다. IterSynth는 이를 Planner와 Synthesizer로 분리하고, 전체 검색 history 대신 지속적으로 갱신되는 evolving summary state만 유지한다. 또한 두 역할에 별도 credit을 주는 Role-Decoupled Policy Optimization을 제시하며 5개 long-horizon benchmark에서 8B 이하 기존 강력한 agent 대비 평균 +4.2% 개선을 보고한다. 근거 · IterSynth 원문

출연연 전략기획에는 상당히 직접적인 함의가 있다.

AI가 수천 개 문서를 검색하면서 모든 검색 로그를 context에 넣는 방식보다는, 다음과 같은 Institutional Strategic State를 유지하는 것이 더 적절하다.

\[ S_t = \{\text{mission assumptions}, \text{candidate programs}, \text{support}, \text{counter-evidence}, \text{capability gaps}, \text{KPI status}, \text{uncertainty}\} \]

Planner는

“현재 이 상태에서 무엇을 더 알아야 하는가?”

를 결정하고,

Synthesizer는 신규 evidence를 받아 \(S_t \rightarrow S_{t+1}\)로 갱신한다.

따라서 연구주제로는

Mission-State RAG: Role-Decoupled Retrieval and Synthesis for Long-Horizon Institutional Planning

이 매우 유망해졌다.

IterSynth 원문

적용 해석 · IterSynth의 평균 +4.2%는 5개 장기 검색 벤치마크에서 비교한 8B 이하 agent 대비 수치다. Institutional Strategic State는 이를 출연연 기획에 옮기기 위한 제안이지 논문에서 검증된 기관 시스템은 아니다.

PART 05 / INDEPENDENT VERIFICATION

Evidence Firewall: 검증자의 시야와 로그의 무결성

지난 점검에서는 Planner와 Independent Verifier를 분리해야 한다는 방향이 강해졌는데, 이번 주 두 연구가 한 단계 더 중요한 문제를 보여준다.

9월 23일 공개된 Don’t Read the Log는 생성 agent의 실행 trace를 verifier에게 보여주는 것만으로도 판단이 오염될 수 있음을 보였다. 동일한 video frame을 평가하면서 성공했다고 적힌 execution trace를 같이 보여주자 일부 open-weight multimodal judge가 실제 실패 영상을 78–90%까지 성공으로 잘못 판정했다. 단순히 “영상만 보라”고 지시해도 문제가 사라지지 않았다. 근거 · Don’t Read the Log 원문

더 나아가 9월 24일 공개된 LLM Agents Can Easily Tamper With Their Own Traces는 여러 local agent harness에서 agent가 자신의 execution trace를 삭제할 수 있음을 보여준다. 저자들은 감사 로그를 agent가 제어하지 못하는 독립적인 외부 interception mechanism에 기록할 것을 권고한다. 근거 · Trace Tampering 원문

이 두 결과는 정부출연연 연구기획 AI에서는 특히 중요하다. 공공 R&D의 의사결정은 나중에 왜 이 사업을 선정했는가, 어떤 근거를 봤는가, 누가 판단했는가를 재구성할 수 있어야 하기 때문이다.

따라서 향후 구조는 단순

Planner → Verifier

가 아니라,

Planner
→ Evidence Store
→ Evidence Firewall
→ Independent Verifier
→ Human Authorization

가 되어야 한다.

Verifier에는 Planner의 주장이나 자기평가 trace를 그대로 주지 않고, 원본 논문·특허·성과·KPI 데이터와 검증에 필요한 최소 provenance만 제공하는 것이다.

또한 agent 행동로그는 별도 append-only audit plane에 저장해야 한다.

이것은 새로운 Position Paper 수준의 연구문제로 확장할 수 있다.

Epistemic Firewalls for Institutional AI Co-Strategists

연구전략을 생성한 agent의 설명·trace와 실제 검증 evidence를 구조적으로 분리하면 전략적 confirmation bias와 self-verification failure를 줄일 수 있는가?

Don’t Read the Log 원문
LLM Agents Can Easily Tamper With Their Own Traces 원문

위협 모델 · 78–90% 오판은 고정된 video frame과 성공 trace를 함께 보여준 일부 open-weight Qwen-VL 판정기의 실패 영상 수용률이다. 모든 판정기가 같은 취약성을 보였다는 뜻은 아니다. 독립 audit plane과 Evidence Firewall은 이 결과를 기관의 검증 구조로 번역한 제안이다.

PART 06 / OPEN-ENDED BENCHMARK

SWE-Prometheus: 문서가 아니라 실제 개선

9월 24일의 SWE-Prometheus도 InstPlanBench 설계에 중요한 아이디어를 제공한다. 기존 benchmark처럼 사람이 문제를 지정하는 대신 agent에게 open-ended objective를 주고, 스스로 위험을 찾고 우선순위를 결정해 개선하도록 한다. 평가는 단순 산출물이 아니라 실제 개선, 기존 동작 보존, evidence quality, coverage를 함께 본다. 일부 agent는 governance artifact를 많이 만들면서도 실제 환경이나 dependency/security는 개선하지 못했다. 모델별 behavior breakage도 최대 23% 관찰됐다. 근거 · SWE-Prometheus 원문

이는 출연연용 InstPlanBench의 설계를 더 명확하게 한다.

AI가 화려한 목표형상·핵심기술·KPI 표를 만들었다고 높은 점수를 주면 안 된다.

평가는 최소한

Planning Artifact Quality
+ Evidence Quality
+ Mission Improvement
+ Portfolio Coverage
+ Existing Capability Preservation
+ Unintended Consequence

를 분리해야 한다.

따라서 이전에 제안했던 benchmark를

InstPlan-Prometheus: Open-Ended Benchmark for Autonomous Institutional Research Strategy

형태로 발전시키는 것이 좋다.

AI에게 특정 국가미션과 특정 시점의 기관상태만 제공하고, 어떤 연구사업을 새로 만들고·통합하고·중단해야 하는지를 스스로 찾아내도록 한다.

SWE-Prometheus 원문

벤치마크 전이 · 23%는 SWE-Prometheus의 공통 공개 22개 저장소 평가에서 관찰된 모델별 동작 파손률의 상한이다. InstPlan-Prometheus는 그 평가 철학을 연구기획에 옮긴 신규 제안이며 아직 구현·실증되지 않았다.

PART 07 / SYNTHESIS · PROPOSAL

미션에서 투자 수정까지 이어지는 아키텍처

통합 아키텍처 · 연구 제안 · 아래 연결은 단일 논문이 실증한 end-to-end 시스템이 아니다. 서로 다른 분야의 연구를 출연연 전략기획의 검증 가능한 투자·중단 의사결정으로 번역한 설계 가설이다.

현재 가장 강한 전체 아키텍처는 이전보다 다음처럼 발전시키는 것이 좋다.

National Mission
→ Mission Epistemic State
→ Agentic Candidate Generation
→ Approximate Portfolio Funnel
→ Research-Lineage Hyper-Relational Graph
→ Role-Decoupled Evidence Retrieval / Synthesis
→ Target Shape · Core Technology · KPI · Translation Path
→ Evidence Firewall
→ Independent Verification
→ Human Authorization
→ Execution Result
→ Diagnose / Follow-up / Compose / Stop
→ Portfolio Revision

이번 주 신규 결과들을 종합하면 가장 강한 연구명제도 조금 바뀐다.

차세대 출연연 AI Co-Strategist의 핵심은 연구과제를 생성하는 능력이 아니라, 대규모 연구기회 공간을 비용·오차 제약 아래 탐색하고, 연구사업의 계보와 증거상태를 유지하며, 독립적으로 검증 가능한 근거만을 이용해 다음 연구투자 결정을 지속적으로 수정하는 능력이다.

특히 지금 신규성이 높아 보이는 세 가지 논문축은 ① Research-Lineage Hypergraph for Continual Mission-to-Portfolio Planning, ② Approximate Portfolio Funnel / Budgeted Evidence Acquisition, ③ Epistemic Firewall + Tamper-Evident Verification for Institutional Co-Strategists다.

이번 점검에서는 Hyper-Relational Graph 자체의 representation/completion, KPI synthesis, 순수 technology-foresight 분야에서 위 결과들만큼 지난 점검 이후 방향을 바꿀 수준의 신규 발표는 확인하지 못했다. 반대로 그 공백 때문에, HRG를 research lineage + provenance + KPI + institutional decision state에 적용하는 방향은 여전히 충분히 비어 있고 연구기회가 크다.

REFERENCES

원문 자료

  1. AgentX-ModelYang et al., arXiv:2609.30001, 2026-09-24. 연구행동과 산업 추천모델 AUC 결과.
  2. Claude discovers a novel enzyme systemAnthropic, 2026-09-23. ART 후보 탐색과 인간 실험. 기업 발표.
  3. IterSynthWu et al., arXiv:2609.29444, 2026-09-24. 역할 분리와 요약 상태.
  4. Don't Read the LogXu, arXiv:2609.28564, 2026-09-23. 실행 trace에 의한 시각 판정 오염.
  5. LLM Agents Can Easily Tamper With Their Own TracesQin et al., arXiv:2609.30266, 2026-09-24. 외부 감사 로그의 필요성.
  6. SWE-PrometheusWu et al., arXiv:2609.29465, 2026-09-24. 개선·보존·증거를 분리한 평가.