범용 LLM의 한계
폭넓은 instruction following과 추론 능력을 제공하지만, 이질적 과학 modality, 도메인 프로토콜, 검증 가능한 도구 상호작용에는 특화되어 있지 않다.
Intern-S2-Preview: Scientific Agentic Foundation Model — 멀티모달 과학 이해·추론·생성과 장기 지평 도구 사용을 하나의 파운데이션 모델로 묶는 시도
과학적 발견은 고립된 질문에 정답을 내놓는 일이 아니다. 이질적 증거를 놓고 계획을 세우고, 도구를 부르고, 실패를 되짚어 다시 시도하는 긴 과정이다.
과학 연구를 지원하는 AI 시스템에는 세 가지가 동시에 요구된다. 이질적 modality의 과학 증거를 놓고 추론할 것, 과학 도구 및 환경과 상호작용할 것, 그리고 긴 task horizon에 걸쳐 진전을 유지할 것. Intern-S2-Preview는 이 세 요구를 하나로 묶은 과학 에이전틱 파운데이션 모델 계열이다. 멀티모달 과학 이해, 추론, 생성, 장기 지평 과제를 모두 지원하도록 설계했다.
학습 파이프라인은 과학 문서를 렌더링한 이미지, interleaved image-text 데이터, 다양한 과학 코퍼스에 대한 멀티모달 사전학습에서 출발한다. 사전학습 체크포인트에서 시작해 통합 후속학습 파이프라인을 적용한다. supervised fine-tuning, 확장 가능한 multi-task RL, 블랙박스·화이트박스 agentic RL, 그리고 on-policy distillation이 그 구성이다. 이 파이프라인은 롤아웃과 학습의 안정성·효율을 끌어올리는 실용 기법들이 떠받친다. off-policy correction을 붙인 partial rollout, adaptive length regularization, online speculative decoding, robust multi-task optimization, 그리고 에이전틱 과제를 위한 trace-aware experience assembly가 그것이다.
아키텍처 층위에서 Intern-S2-Preview-397B는 시계열 모델링을 효율적 long-sequence 이해에서 numerical forecasting까지 확장한다. 한편 Memory Decoder는 397B backbone을 동결한 채 빠른 과학 도메인 특화를 가능하게 하는 별도의 memory-augmented 경로로 연구된다. 과학·멀티모달·에이전틱·범용 벤치마크 전반의 평가에서 397B는 여러 설정에서 경쟁력 있거나 선도적인 결과를 낸다. 시계열 모듈은 SciTS에서 과학 신호 이해와 예측을 개선하고, 별도 확장인 Intern-MemDec-4B는 397B backbone을 건드리지 않고 Biology-Instructions 평균 점수를 56.92에서 60.32로 끌어올린다.
범용 LLM은 과학의 특수성을 모르고, 과학 멀티모달 모델은 정적 문답으로만 평가된다. 그 사이에 비어 있는 자리가 이 보고서의 출발점이다.
대규모 언어모델과 멀티모달 파운데이션 모델의 최근 진전은 AI for Science의 지형을 바꾸고 있다. 모델은 다양한 과학 지식, 관측, 계산 도구를 놓고 추론할 수 있게 되었다. 과학 멀티모달 모델과 벤치마크는 이 방향을 텍스트 너머로 확장한다. 과학 figure, 현미경 이미지, 원격탐사 관측, 지구과학 현상, 수치 시계열에 대한 지각·이해·추론을 평가하는 식이다.
그러나 의미 있는 과학적 발견은 고립된 질문에 옳은 응답을 만드는 것 이상을 요구한다. 이질적 증거에 기반한 지속적 추론과 적응적 계획, 그리고 긴 task horizon에 걸친 도구·외부 환경과의 반복적 상호작용이 필요하다.
폭넓은 instruction following과 추론 능력을 제공하지만, 이질적 과학 modality, 도메인 프로토콜, 검증 가능한 도구 상호작용에는 특화되어 있지 않다.
특수 입력에 대한 지각과 추론은 개선하지만, 여전히 장기 지평 에이전트가 아니라 정적 질의응답 시스템으로 평가되는 경우가 많다.
이 한계가 Intern-S2-Preview를 낳았다. 과학 질의응답을 넘어 반복적이고 도구에 접지된(tool-grounded) 문제 해결로 나아가려는 과학 에이전틱 파운데이션 모델 계열이며, 본 보고서에서 평가되는 주 모델은 Intern-S2-Preview-397B다.
첫째, 수치 신호의 이해와 예측이 동시에 필요하다. 과학 워크플로는 긴 수치 신호를 이해하는 동시에 시스템의 미래 상태를 예측할 것을 요구한다. 397B는 전용 forecasting branch를 추가해 시계열 모델링을 효율적 long-sequence 이해에서 numerical forecasting까지 확장한다.
둘째, 새 도메인으로의 빠른 적응이 필요하다. 범용 능력을 잃지 않으면서 새 도메인에 특화되어야 한다. 이를 위해 모델 파라미터를 다시 쓰지 않는 특화 전략을 탐색한다. 독립적으로 학습된 parametric memory를 동결된 397B backbone에 부착해 추가 도메인 지식과 특화 능력을 주입하는 방식이다.
하나는 시계열을 이해에서 예측까지 밀어 올리는 내부 확장이고, 다른 하나는 동결된 백본에 기억을 붙이는 외부 확장이다.
Memory Decoder는 Intern-S2-Preview-397B 기본 모델의 구성요소가 아니라, 지속적 도메인 특화를 위한 별도의 확장 모델이다. 397B backbone을 동결한 채 외부 parametric memory를 통해 새 지식과 특화 능력을 부착한다. 별도로 학습된 memory decoder가 next-token 분포의 동적 융합을 통해 backbone을 보완한다. 각 디코딩 단계에서 경량 token-level router가 memory decoder의 기여도를 결정한다.
과학 전문성은 long-tail이고 끊임없이 변한다. 397B가 아무리 강한 일반 기반을 제공해도, 고정된 post-trained 체크포인트 하나가 모든 세부 분야와 task 프로토콜, 새로 등장하는 도메인을 덮을 수는 없다. 그렇다고 도메인마다 backbone을 직접 fine-tuning하는 것은 바람직하지 않다. 도메인 성능을 올리는 바로 그 파라미터 업데이트가 일반 추론, 에이전틱 행동, 멀티모달 능력을 교란할 수 있기 때문이다. Memory Decoder는 도메인 확장을 backbone 재작성이 아니라 모듈형 메모리 부착으로 바꿔 이 trade-off를 피한다.
도메인 SFT 코퍼스 𝒟sft = {(q(i), a(i))}i=1N이 주어지면 answer-side 위치에 대해 token-level datastore를 만든다. 각 target token에서 prefix는 ct(i) = [q(i); y<t(i)], key는 kt(i) = φ(ct(i)), value는 yt(i)이며 φ(·)는 동결되어 있다. 이 datastore에 대한 최근접 이웃 검색이 soft next-token teacher 분포를 제공한다.
메모리 학습은 검색 증류와 gold answer token 지도를 결합한다.
추론 시 397B와 Memory Decoder는 같은 디코딩 문맥을 병렬로 처리한다. prefix ct = [x; y<t]에 대해 동결된 backbone은 pS2(· | ct)를, memory decoder는 pmem(· | ct)를 낸다. 경량 token-level router가 두 모델의 hidden representation과 confidence·entropy 특징을 받아 융합 계수 λt ∈ [0,1]을 예측한다.
router 학습 동안 397B와 Memory Decoder는 모두 동결되고 router만 도메인·일반 instruction 데이터 혼합으로 최적화된다. 융합 분포에 대한 cross-entropy에 더해 memory weight에 signed linear regularizer를 적용한다.
부호가 방향을 정한다. 도메인 예제에서는 메모리 가중치를 키우는 쪽으로, 일반 예제에서는 줄이는 쪽으로 router를 민다. 특화와 일반성의 경계를 손으로 긋는 대신 손실 함수에 새긴 셈이다.
과학 시계열은 길이, 샘플링 주파수, 채널 의존성에서 편차가 크다. 효율적이면서 표현력 있는 모델링이 어려운 이유다. 397B는 Intern-S1-Pro 대비 long-sequence 처리 효율과 multi-channel 표현 학습을 개선한 인코더를 쓴다.
입력 시계열은 먼저 temporal chunk로 분할되어 긴 시퀀스의 국소 처리를 가능하게 한다. 각 chunk는 compressive patching module을 통과한다. 정규화, CNN 기반 국소 특징 추출, Q-Former 기반 시간 압축의 세 단계다. 정규화 과정에서 channel-wise 평균과 표준편차는 보조 통계로 보존된다. 추출된 국소 표현은 temporal patch로 나뉘고, 각 patch는 learnable query를 가진 Q-Former가 고정 개수의 토큰으로 압축한다. 입력 길이에 따라 patching 과정을 동적으로 조정하므로 이질적인 긴 시계열에 대해서도 출력 시퀀스 길이를 제어할 수 있다.
Intern-S1-Pro의 인코더는 multi-channel 표현을 mean pooling으로 곧장 집계했다. 397B는 그 대신 channel-wise Transformer encoder를 도입해 채널 간 의존성을 먼저 모델링한 뒤 Transformer encoder body에 넣어 전역 시간 문맥을 다룬다. 시계열 인코더와 LLM 사이의 연결은 그대로 유지된다.
약 240,000 → 300,000 time steps
약 5~6배 빠르고 GPU 메모리는 이전 버전의 약 20%
고주파수이면서 짧은 시퀀스 길이를 가진 신호 모델링. Intern-S1-Pro가 지원하지 못하던 영역이다.
천문학, 지구과학, 신경과학, 생리 신호 분석, 생물음향학에 더해 레이더 신호 분석(~MHz)까지
이해를 넘어 예측이 필요한 이유는 분명하다. 미래 시스템 상태를 예측할 수 있어야 과학 과제의 범위가 넓어진다. 397B는 멀티모달 LLM 프레임워크 안에서 시계열 이해와 생성을 통합하는 forecasting module을 넣었다. 값을 discrete text token으로 생성하는 대신 전용 numerical forecasting branch를 도입한 것이 핵심이다. 수치 충실도를 지키면서 계산 효율도 유지한다.
과학 코퍼스의 지식은 글자에만 있지 않다. 레이아웃, 그림과 본문의 관계, 페이지를 넘나드는 추론 사슬에도 있다.
Visual Pre-training(VP)은 modality 확장을 위한 경량 단계다. 대규모 unlabeled 과학 문서를 페이지 이미지로 렌더링해 학습하며, 텍스트 추출 과정에서 유실될 수 있는 figure, 표, 수식, 레이아웃 정보를 보존한다. 같은 문서 코퍼스의 시각적 표현에서 직접 학습함으로써 기존 텍스트 사전학습을 보완한다.
페이지 이미지 ℐ가 주어지면 동결된 visual encoder가 시각 특징 시퀀스 𝒵 = Ev(ℐ) = (z1, …, zN)을 추출한다. foreground mask mi가 빈 영역을 제거하고, 남은 특징은 raster-scan 순서로 배열된다. 이 시퀀스는 LLM hidden space로 투영되어 autoregressive하게 모델링된다.
VP는 contrastive next-latent prediction 목적으로 학습한다. 예측·타깃 인덱스 t, j ∈ ℬ에 대해 온도 스케일된 코사인 유사도와 매칭 확률은 다음과 같다.
지속 사전학습 동안 텍스트와 시각 샘플은 다음 결합 목적 아래 interleave된다.
visual encoder는 동결하고 LLM backbone, visual projection, prediction head만 최적화한다. 지도 신호를 시각 특징에서 직접 얻으므로 VP에는 OCR도 레이아웃 파싱도 필요 없고 paired data와 수작업 주석도 필요 없다. 텍스트 사전학습에 대한 확장 가능한 보완책인 셈이다.
멀티모달 대형 모델의 사전학습에서 image-text pair만으로는 실제 PDF 문서의 이해 요구를 다 덮지 못한다. 기존 전략은 image caption 데이터에 크게 기대는데, 이는 이미지와 국소 텍스트 구간 사이의 의미 정렬을 포착한다. 객체 인식, 이미지 서술, 국소 visual-semantic 모델링에는 적합하다.
그러나 PDF에서 더 중요한 정보는 이미지·수식·표·주변 텍스트 사이의 문맥적 관계에 있다. 레이아웃 위치, 시각 요소 앞뒤의 설명 문단, 본문 참조, 페이지를 가로지르는 추론 사슬, 긴 문서에서 지식이 점진적으로 조직되는 방식이 그것이다. 그래서 PDF로부터 interleaved image-text 데이터를 따로 구성한다. 이미지가 무엇을 그리는지만이 아니라, 그것이 문서 서사에 어떻게 박혀 있고 지식 표현과 추론에 어떻게 참여하는지를 배우게 하려는 것이다.
| # | 단계 | 내용 |
|---|---|---|
| 1 | PDF Layout Parsing | MinerU2.5-Pro로 OCR 및 레이아웃 인지 구조 파싱. 텍스트 블록, 헤딩, 문단, 시각적으로 유의미한 영역을 식별 |
| 2 | Visual Unit Cropping | regular image, interline equation, table 세 유형을 bounding box에 따라 잘라 표준화된 sub-image로 저장 |
| 3 | Page-level Interleaved Sequence | 텍스트 블록과 시각 단위를 레이아웃 reading order와 bounding-box order에 따라 재배열 |
| 4 | Visual-Gain Filtering | text-only 조건과 interleaved 조건의 perplexity 차이를 visual gain으로 정의. 도메인별 임계값과 사람 검토를 결합해 임계값을 넘는 페이지만 보존 |
| 5 | Document-level Concatenation | 필터링된 페이지 시퀀스를 원래 PDF 페이지 순서로 이어붙임 |
| 6 | Long-Context Chunking | chunk 길이 최대 256K 토큰, 512-token overlap |
| 7 | Domain Focus | 생명과학, 화학, 재료과학 |
| 8 | Final Corpus | 문서에 접지된 고품질 사전학습 시퀀스 |
Δ = PPLwithout_image − PPLwith_image. 시각 정보를 추가했을 때 PPL이 크게 떨어진다면 그 시각 콘텐츠가 페이지 이해에 실질적으로 기여한다는 뜻이다. 장식용 이미지, 광고, 관련성 낮은 시각 요소는 대체로 낮은 visual gain을 낸다. 반면 실험 figure, 메커니즘 다이어그램, 구조 삽화, 표, 수식을 담은 과학 페이지는 뚜렷한 PPL 감소를 가져온다. 데이터 품질을 취향이 아니라 측정으로 판정한 것이 이 장치의 미덕이다.
고품질 데이터 검색은 텍스트 사전학습 코퍼스 준비에서 흔한 관행이다. 그러나 고품질 이미지 데이터를 검색하는 파이프라인은 충분히 탐색되지 않았다. 그래서 대규모 이미지 검색 파이프라인을 도입해 좋은 데이터를 불러오고 학습 중 그 샘플 비율을 높인다.
text-to-image와 image-to-image 두 모드를 지원한다. 벡터 공간의 일관성을 위해 두 모드 모두 구축 단계와 동일한 embedding model을 쓴다.
중복 샘플 필터링, reranker model을 통한 재순위화 및 품질 점수 부여, 그 점수를 이용한 최종 필터링을 적용한다.
긴 꼬리 하나가 배치 전체를 붙잡는다. 이 문제를 푸는 네 가지 장치가 후속학습 파이프라인의 실질을 이룬다.
사전학습 체크포인트에서 출발하는 파이프라인은 일반 추론, instruction following, 도구 사용, 장기 지평 에이전틱 행동을 강화하는 동시에 과학 지능의 세 핵심 능력을 개선한다. 과학적 추론, 과학 modality 전반의 생성, 그리고 과학 에이전틱 문제 해결이다.
SFT 데이터 혼합은 일반 대화, instruction following, 안전성 정렬, 코드 생성과 추론, image–text 이해, 시각 지각과 공간 grounding, 도구 사용, 특화된 과학 과제, 장기 지평 에이전틱 궤적을 포함한다. 데이터 품질을 위해 광범위한 필터링·정제·중복 제거를 적용했다. 명시적 추론이 필요한 과제에서는 이전 세대 모델 Intern-S1-Pro와 여러 선도 오픈소스 모델을 함께 써서 rejection sampling으로 고품질 chain-of-thought 시연을 구성했고, 그 결과 샘플을 언어모델과 사람 도메인 전문가가 다시 검증해 사실 정확성·추론 품질·형식 일관성을 높였다.
Long-reasoning 강화학습은 응답 길이의 long-tail 분포에 특히 취약하다. 동기적 롤아웃 파이프라인에서는 예외적으로 긴 생성 몇 개가 배치 전체의 완료를 지연시키고, 그동안 대부분의 GPU는 낙오자를 기다리며 놀게 된다. 기존 시스템은 보통 학습과 추론을 같은 자원에 co-locate하면서 partial rollout을 쓰거나, 롤아웃 생성과 정책 최적화를 별도 GPU 풀로 완전히 분리한다.
이 보고서는 XTuner 학습 엔진과 LMDeploy 추론 엔진에 기반한 co-located partial-rollout 시스템을 개발했다. 롤아웃 생성 동안 추론 엔진에 새 요청이 계속 공급되어 GPU 활용률을 높게 유지한다. 완료된 궤적 수가 학습 배치를 이루기에 충분해지면, 남은 in-flight 롤아웃은 중단되거나 폐기되는 대신 현재 생성 위치에서 일시 정지된다. 생성된 prefix와 롤아웃 메타데이터는 보존되고, 같은 GPU 풀이 추론에서 정책 학습으로 전환한다. 정책 업데이트 후 학습 상태를 offload하고 갱신된 파라미터를 추론 엔진에 동기화하면, 정지되었던 요청이 보존된 prefix에서 생성을 재개한다. 현재 학습 배치에는 완료된 궤적만 들어간다.
pause-and-resume은 long-tail 생성을 기다리지 않으면서 미완성 응답에 이미 쓴 계산을 살린다. 동시에 학습과 추론 자원을 분리한 완전 비동기 시스템에서 흔히 부딪히는 까다로운 producer–consumer 균형 문제도 피한다.
재개된 궤적은 하나 이상의 정책 업데이트 전후에 생성된 구간을 함께 담을 수 있다. 같은 궤적 안의 토큰이 서로 다른 behavior-policy 버전에서 나올 수 있다는 뜻이다. 그래서 샘플링된 모든 토큰에 대해 behavior-policy 버전과 생성 시점 log-probability를 기록한다.
궤적의 staleness는 명시적으로 제한한다. 가장 오래된 보존 구간이 현재 learner보다 세 번 이상 앞선 정책 업데이트 시점에 생성되었다면 그 궤적은 폐기한다. 그리고 importance ratio를 잘라낸다.
잘린 ratio는 REINFORCE 목적에서 detached importance weight로 쓰인다. surrogate objective를 자르는 PPO식 clipping은 trust region 밖 토큰의 gradient를 완전히 억눌러 버릴 수 있다. 반면 importance weight 자체를 자르면 업데이트 분산은 묶으면서도 마스킹되지 않은 모든 토큰에서 0이 아닌 policy-gradient 기여를 유지한다.
MoE 정책에서는 두 엔진 사이의 expert-routing 차이와 수치 차이 양쪽에서 불일치가 생긴다. 전자에는 Rollout Routing Replay(R3)를 쓴다. LMDeploy가 롤아웃 중 내린 expert 선택을 기록해 두었다가 XTuner가 해당 토큰을 평가할 때 그대로 재생하는 방식이다. 롤아웃과 학습이 같은 expert 경로를 따르게 된다. 여기에 Intern-S1-Pro를 따라 정렬된 mixed-precision 구성을 쓴다. expert linear layer는 FP8, 나머지 layer는 BF16, 그리고 수치적으로 민감한 연산은 FP32로 계산한다.
apply_rope, RMSNorm, MoE router, Gated DeltaNet의 recurrent state, language-model head.
routing replay와 연산 수준 정렬 이후에도 잔여 수치 차이 때문에 일부 토큰은 여전히 큰 확률 격차를 보일 수 있다. KPop에서 착안해 bidirectional binary KL divergence로 이런 이상치를 탐지한다.
역할 분담이 깔끔하다. R3는 이산적인 expert-routing 불일치를 제거하고, BKL mask는 남은 토큰 수준 수치 이상치를 걸러낸다.
Long-CoT 추론 모델은 비교적 쉬운 문제에서도 과도하게 생각하는 경향이 있다. 훨씬 적은 계산으로 정답에 이를 수 있는데도 불필요하게 긴 추론 궤적을 만든다. 기존 접근은 명시적 length-aware reward나 제약, query-adaptive length penalty, 또는 별도의 length-control fine-tuning 단계로 이를 개선한다. 효과는 있지만 대가가 있다. reward 기반 접근은 task reward와 충돌할 수 있는 보조 목적을 도입하고, 추가 fine-tuning 단계는 파이프라인을 복잡하게 만들며 앞선 RL 단계에서 얻은 능력을 흔들 수 있다.
그래서 독립적인 reward 신호를 추가하지 않고 positive response의 advantage를 직접 재가중하는 방법을 쓴다. 원칙은 둘이다.
query q에 대해 𝒢q = {1,…,G}가 G개 샘플 응답의 인덱스이고 Âi가 응답 i의 원래 advantage일 때, positive response 집합을 정의한다.
positive response 중에서 짧은 해답은 더 큰 가중치를, 긴 해답은 더 작은 가중치를 받되 여전히 양의 advantage는 유지한다. 정규화 항이 전체 positive advantage 질량을 근사적으로 보존하므로, 최적화 스케일 자체를 크게 바꾸지 않으면서 성공한 응답들 사이의 상대적 선호만 바꾼다. 결국 어려운 query에서의 탐색으로부터 이미 정복한 query에서의 효율 최적화로 적응적으로 이행하는 셈이다.
Intern-S2-Preview-35B를 adaptive length regularization 유무로 비교했을 때 두 설정의 reward 곡선은 비슷하고, 평균 출력 길이는 크게 줄었다. 성능을 희생하지 않고 추론 효율을 개선했다는 뜻이다.
co-located partial rollout이 GPU 활용률을 크게 올려도, 긴 추론 궤적은 여전히 autoregressive하게 생성되어야 하므로 롤아웃은 RL 학습에서 가장 시간이 오래 걸리는 단계 중 하나로 남는다. speculative decoding이 보완책이 된다. 경량 draft model이 여러 후보 토큰을 먼저 제안하면 현재 정책 모델이 정확한 rejection-sampling 절차로 병렬 검증한다. 이 검증 절차가 정책 모델의 샘플링 분포를 보존하므로, 추가적인 off-policy bias 없이 롤아웃 생성을 가속한다.
문제는 정책 모델이 학습 중 계속 변한다는 데 있다. 고정된 draft model은 정책이 갱신될수록 낡아지고, 출력 분포 불일치가 커지면서 token acceptance rate가 점진적으로 떨어진다. 그래서 draft model을 최신 정책이 생성한 궤적으로 온라인 학습한다. 매 RL iteration마다 새로 수집된 롤아웃 상태에서 현재 정책의 토큰 분포로 draft model을 갱신하되, gradient는 정책 모델을 통과하지 못하게 막는다.
학습에는 hybrid LK Loss를 쓴다. forward KL divergence의 안정적 최적화 거동과 total variation distance의 직접적 acceptance-rate 최적화를 결합한 것이다.
무손실 speculative sampling에서 기대 토큰 수용 확률은 target과 draft 분포의 겹침과 같다.
계수가 스스로 국면을 바꾼다. draft model이 현재 정책과 잘 맞지 않으면 acceptance rate ᾱk가 낮고 λk는 1에 가까워지므로 목적은 forward KL 항이 지배한다. 진화하는 정책에 draft 분포를 빠르게 맞추는 매끄럽고 잘 스케일된 gradient가 필요한 국면이다. 정렬이 좋아져 acceptance rate가 오르면 λk가 줄고 TV 항의 비중이 커진다. TV distance 최소화는 분포 겹침 최대화와 동치이므로, 목적은 안정적 분포 매칭에서 직접적 acceptance-rate 최적화로 서서히 이동한다.
온라인 draft 적응과 hybrid LK 목적 덕분에 acceptance rate는 RL 학습이 진행돼도 떨어지지 않고 계속 개선된다. 대규모 학습 실행에서 speculative decoding은 롤아웃 생성에 약 2배, 전체 RL 학습 파이프라인에 1.7배의 end-to-end 가속을 가져왔다.
RL은 구조, 해의 다양성, 정책 탐색의 불확실성이 서로 다른 이질적 과제 혼합 위에서 수행된다. 같은 정책 아래에서도 과제마다 다른 엔트로피 국면이 유도되므로, 전역 또는 토큰 수준 엔트로피 조절만으로는 이질적 탐색 요구를 감당할 수 없다. 이 이질성은 group 기반 정책 최적화 방법에 엔트로피 의존적 편향을 유발해, prompt group 사이의 advantage 신호를 통계적으로 비교 불가능하게 만든다.
그래서 GEPO(Group-level Entropy-Controlled Policy Optimization)를 적용한다. 이미 존재하는 grouped sample에서 직접 추정한 group-level entropy를 진단 신호로 삼아, 엔트로피 이질성이 유발한 최적화 편향을 식별하고 완화한다. 구체적으로 저엔트로피 group에서는 positive advantage를 감쇠시켜 엔트로피 격차를 더 벌리는 과도한 착취를 막고, 고엔트로피 group에서는 negative advantage를 감쇠시켜 탐색이 조기에 억눌리지 않게 한다.
저엔트로피 group은 공격적 개입에 더 취약하고 length collapse를 촉발할 수 있으므로, 고엔트로피 group보다 완만한 감쇠를 받아야 한다.
GEPO는 이질적 과제를 공통 엔트로피 목표로 몰아붙이는 대신, 과제별 탐색 국면을 보존하면서 정책 업데이트에 대한 실효 기여만 재조정한다. 명시적 task 주석도 추가 롤아웃도 필요 없고 기존 group 기반 최적화 파이프라인에 곧장 통합된다.
reasoning RL은 Intern-S1-Pro에서 쓴 leave-one-out REINFORCE 형식을 따르며, 위의 안정화·효율 기법을 덧붙인다. query마다 G개 응답 그룹을 샘플링해 sequence-level verifier reward {Ri}를 얻는다. DAPO의 dynamic sampling에 따라, reward가 전부 동일한 query group은 온라인에서 걸러내고 새로 샘플링한 group으로 대체한다.
이 목적은 세 가지 보완적 안정화 장치를 결합한다. 잘린 importance weight는 pause-and-resume partial rollout과 반복적 mini-batch 업데이트가 유발한 정책 불일치를 교정한다. R3는 두 엔진의 expert-routing 결정을 정렬하고, BKL mask는 routing·연산 정렬 이후 남은 수치 이상치를 제거한다. GEPO와 adaptive length regularization은 sequence-level advantage를 재형성해 과제별 탐색과 추론 효율의 균형을 잡는다. speculative decoding은 정책의 샘플링 분포를 보존하므로 식 (29)를 바꾸지 않고 롤아웃만 가속한다.
Muon, learning rate 1×10−6, weight decay 0.01
롤아웃 배치당 완료 응답 8,192개, mini-batch 8 step 최적화
최대 65,536 tokens
정책 업데이트 3회 초과 시 궤적 폐기
에이전트를 어떻게 굴릴지와 무엇을 풀게 할지는 다른 문제다. 이 둘을 떼어 놓아야 조합이 가능해진다.
reasoning RL은 단일 응답과 생성 지향 행동을 개선한다. 그러나 과학 에이전트는 도구, 파일, 외부 프로그램, 환경 피드백이 얽힌 상호작용 세션에서도 배워야 한다. 그래서 agent 실행 인터페이스와 task 분포를 분리하는 harness × task 추상화를 중심으로 통합 에이전틱 RL 프레임워크를 구축했다.
에이전트가 어떻게 인스턴스화되고, 구동되고, 관찰되는지를 규정한다.
초기 환경, 실행 가능한 목표, verifier가 정의한 결과를 규정한다.
둘의 합성이 이질적 agent 실행을 공통 형태의 RL 경험으로 바꾼다. 명시적 환경을 가진 상호작용 롤아웃, 관찰 가능한 action–observation 이력, 그리고 자동 결과 신호가 그 형태다. 이 형식화 덕분에 에이전틱 학습은 두 축을 따라 확장된다. harness 축으로는 제어 루프를 직접 조율할 수 있는 화이트박스 구현과 native CLI·SDK·model API로 통합되는 블랙박스 런타임을 모두 지원한다. task 축으로는 특화된 코딩·터미널 환경과 자기진화 task-synthesis 시스템이 만든 범용 과제를 함께 다룬다.
인프라는 통합 롤아웃 런타임과 trace 인지 experience-assembly 층으로 구성된다. 전자는 이질적 harness를 실행 가능한 task와 합성해 공통 세션 계약 아래 굴리고, 후자는 의미적 궤적과 verifier 피드백을 정책 최적화에 필요한 정확한 토큰 수준 증거와 결합한다.
롤아웃 시점에 Agent Rollout Runner가 harness–task 쌍을 받아 실행 환경을 준비하고 정상 완료 또는 종료 조건까지 상호작용을 관리한다. harness가 에이전트를 구동하는 동안 Judger Adapter가 동일한 세션 상태와 실행 산출물에 대해 결과 검증과 과정 주석을 수행한다. Shared Sandbox Provider는 로컬·원격·커스텀 백엔드에 걸쳐 환경 생성, 명령·도구 실행, 격리, 오류 처리, 자원 정리를 추상화한다. 그 결과 agent 제어, 환경 준비, 검증이 서로 독립적으로 진화하고 조합될 수 있다. 조합마다 전용 롤아웃 파이프라인을 새로 만들 필요가 없다.
Agent Gateway & Adapter가 화이트박스·블랙박스·커스텀 harness 구현 위에 안정적 인터페이스를 노출한다. 화이트박스 루프는 직접 조율할 수 있고, 블랙박스 harness는 native message, tool loop, 제어 흐름을 그대로 유지한다. 어댑터는 세션 생애주기 이벤트, 모델 호출, 상호작용 산출물을 번역하되 런타임이 harness 내부 agent 로직에 접근하거나 그것을 다시 구현하도록 요구하지 않는다. 새 harness를 추가하는 데 필요한 것은 얇은 통합 어댑터 하나이지 새 RL 실행 스택이 아니다.
OpenClaw · Claude Code · OpenCode · OpenHands · Mini-SWE
블랙박스 harness마다 기대하는 모델 프로토콜이 다르다. LLM 서빙 층은 OpenAI Chat Completions, OpenAI Responses, Anthropic Messages를 받고 일반 생성과 스트리밍 생성을 모두 지원한다. 요청은 gateway에서 정규화되어 분산 추론 워커로 전달되고, 스트리밍된 텍스트·추론·tool-call 이벤트는 native 형태로 harness에 중계된다. 클라이언트 입장에서는 평범한 모델 서비스로 보인다. 그와 동시에 서빙 층은 학습 전용 증거를 투명하게 포착한다. 정확한 입출력 token ID, 롤아웃 log probability, 토큰별 MoE router expert가 그것이며, 이 확장은 에이전트 제어 로직에 노출되지 않는다.
이 서빙 경로는 token-in–token-out(TITO) 인터페이스로 구현된다. 모델 호출마다 Session Server는 세션에 이미 기록된 정확한 tokenized prefix를 재사용하고 새로 덧붙은 문맥만 tokenize해 token ID를 추론 엔진에 곧장 보낸다. 반환된 토큰과 정책 통계는 에이전트에 전달되는 동일한 응답 스트림에서 포착된다. sparse MoE 모델에서는 R3가 롤아웃 시점 expert 선택을 추가로 기록해 학습에서 재사용한다. TITO가 샘플링된 토큰 시퀀스를 보존한다면, R3는 그 토큰을 만들어 낸 조건부 계산 경로를 보존한다.
롤아웃 런타임은 하나의 상호작용에 대해 상호보완적인 두 시선을 만든다.
Agent Runner와 Judger Adapter가 만드는 action–observation 궤적, 결과 reward, 과정 주석, 세션 메타데이터
LLM Serving이 만드는 token ID, loss label, behavior log probability, router expert
두 시선을 분리해 두면 환경 대면 로직과 모델 특화 학습 표현이 서로 얽히지 않으면서도, 에이전트의 한 행동에서 그것을 생성한 정책 토큰까지 무손실 경로가 유지된다.
Trace Store는 각 세션을 incremental PrefixTree로 조직한다. 각 노드는 새로 덧붙은 문맥 델타 또는 assistant 응답을 나타내며 그 token ID, label, 롤아웃 log probability, router expert를 저장한다. longest-prefix matching으로 세션의 안정적 이력을 재사용하고 새로 관찰된 구간만 덧붙인다. 어떤 궤적이 학습에 선택되면 store가 대응하는 root-to-leaf 경로를 실체화한다. system instruction, user message, tool observation은 loss에서 마스킹되고 적격한 정책 생성 구간만 학습 label을 유지한다.
증분 저장을 넘어 PrefixTree는 multi-turn과 분기 상호작용에 걸쳐 모델 호출의 계보와 정확한 경계를 보존한다. 그래서 의미적 agent 행동과 그것의 롤아웃 시점 토큰 구간 사이에 안정적 대응이 성립한다. 이 대응이 아래의 과정 인지 credit assignment의 토대가 된다.
특화된 코딩·터미널 능력을 위해서는 공개 컬렉션에서 실행 가능한 과제를 큐레이션한다. 더 넓은 능력을 위해서는 자기진화 task-synthesis 시스템이 커뮤니티 기여 skill을 범용 에이전틱 과제로 변환한다. 두 출처의 과제는 초기화된 실행 환경, 자연어 목표, 자동 verifier로 이루어진 공통 계약으로 정규화된다. 그래서 이질적 과제가 서로 다른 harness와 합성되어 같은 RL 프레임워크 안에서 학습될 수 있다.
Table 1 — 실행 가능한 코딩·터미널 과제 구축에 쓰인 공개 소스
| Provider | Collection | #Tasks | #Environments |
|---|---|---|---|
| SWE-bench | SWE-smith | 59,136 | 222 |
| SWE-Gym | SWE-Gym | 2,438 | 2,401 |
| R2E-Gym | R2E-Gym-V1 | 7,480 | 8,101 |
| Nebius | SWE-rebench-V2 | 32,100 | 32,075 |
| AweAI-Team | Scale-SWE | 20,200 | 19,472 |
| NVIDIA | Nemotron-Terminal-Synthetic-Tasks | 80,000 | 8 |
| RUC-AIBOX | ClawGym-Task | 13,500 | 1 |
일부 컬렉션은 실제 GitHub 이슈·pull request·저장소 이력을 채굴하고, 다른 것들은 소프트웨어 공학 환경을 절차적으로 구성하거나 터미널·워크스페이스 과제를 합성한다. 저장소 수준 이슈 해결, 디버깅과 테스팅, 소프트웨어 설치, 파일·데이터 조작, 그리고 더 넓은 터미널 기반 문제 해결을 아우른다.
각 인스턴스는 공통 task 계약으로 매핑된다. base repository나 컨테이너와 필요한 자산을 초기 환경으로 실체화하고, 이슈 서술이나 지시를 task 목표로 옮기고, 테스트나 reward 프로그램을 verifier로 보존하는 식이다. 이 정규화는 소스별 실행·reward 의미를 보존하면서 롤아웃 런타임에는 일관된 인터페이스를 노출한다. 특히 이 과제들은 정적인 instruction–response 쌍으로 환원되지 않고 살아 있는 환경에 접지된 채 남는다. 그래서 reward가 프로그램 동작, 저장소 상태, 과제별 실행 결과를 반영한다.
커뮤니티 기여 skill을 여러 출처에서 수집해 시스템의 씨앗으로 삼는다. skill은 구체적 사용자 워크플로와 그에 필요한 도구·의존성을 서술하므로 실행 가능한 과제 합성의 자연스러운 토대가 된다.
오류가 있는 단계는 상호작용 문맥에 그대로 남되 skip으로 표시되어 imitation loss에서 제외된다. 나머지 응답은 최적화 대상이 된다. 결함 있는 중간 행동을 모방하지 않으면서도 이후 행동의 인과적 문맥은 파괴하지 않는다.
에이전틱 경험 위의 최적화는 단일 턴 응답 최적화를 넘는 문제를 낳는다. verifier는 도구가 뒤섞인 세션 전체를 채점하는데 학습 가능한 것은 선택된 정책 생성 구간뿐이다. 게다가 실행 가능한 환경은 reward 채널을 solution leakage, test 조작을 비롯한 여러 형태의 reward hacking에 노출시킨다.
에이전틱 세션에는 system instruction, user message, tool call, 환경 관찰로 나뉜 여러 assistant 응답이 들어 있을 수 있다. 그럼에도 이 구간들은 함께 하나의 과제를 풀고 하나의 최종 결과 reward를 받는다. 같은 과제에 대한 롤아웃 group 안에서 롤아웃 i의 전체 세션 reward로부터 group-relative advantage Ai를 계산한다. 동일한 세션 advantage가 그 trace의 적격한 모든 정책 생성 구간에 할당된다. 각 모델 호출을 독립적으로 보상받는 에피소드로 취급하지 않는다는 뜻이다.
결과만으로 credit을 주면, 세션이 잘못된 출력·무효하거나 반복된 tool call·불필요한 복구 시도·비정상 종료에도 불구하고 결국 성공했을 때 바람직하지 않은 중간 행동이 강화될 수 있다. 그래서 결과 평가와 과정 피드백을 분리한다. 결과 verifier는 과제가 풀렸는지를 판정하고, 과정 annotator는 결정론적 과정 오류를 보인 특정 assistant message에 adv_penalty를 붙인다. 이 주석은 세션 reward도 토큰 label도 바꾸지 않는다.
과정 가중치는 파싱·형식 오류, 무효한 tool 이름이나 인자, 반복되거나 실패한 tool call, context·turn·session 한계 종료에 대해 positive credit을 억제하거나 뒤집을 수 있다. positive advantage에만 적용되므로 실패한 궤적의 negative 학습 신호는 보존된다.
소프트웨어 공학, 범용, 터미널 과제 전반에 동일한 학습·experience assembly 경로를 쓴다. harness마다 별도 RL 파이프라인을 두지 않는다. 범용 과제는 Claude Code와 OpenClaw 양쪽에서 빠르게 개선된 뒤 안정화된다. 더 긴 지평의 SWE·터미널 과제는 harness에 따라 과도 구간의 편차가 크지만, 최적화 구간 안에서 개선되거나 회복된다.
서로 다른 동역학은 예상된 결과다. harness가 상호작용 정책과 문맥 구성을 정하고, task가 환경과 reward 의미를 정하기 때문이다. 따라서 공유된 상승 추세는 공통 trace·credit assignment·최적화 스택이 서로 다른 harness–task 조합에서도 유효하다는 증거이지, 그들의 절대 reward 스케일이 직접 비교 가능하다는 증거가 아니다.
이질적인 추론 과제와 에이전틱 과제를 한 정책에서 동시에 최적화하면 충돌이 생긴다. 그래서 전문가를 따로 기른 뒤 증류로 합친다.
혼합 강화학습으로도 단일 정책이 넓은 능력을 얻을 수는 있다. 그러나 극히 이질적인 추론 과제와 에이전틱 과제를 함께 최적화하면 최적화 충돌이 생기고, 모델이 도메인 특화 학습 신호를 온전히 활용하지 못할 수 있다. 그래서 동일한 SFT 체크포인트에서 두 전문가 정책을 따로 학습한다. 혼합 reasoning RL로 얻은 reasoning expert와 대규모 블랙박스·화이트박스 agentic RL로 얻은 agentic expert다.
다수의 세분화된 도메인 전문가를 학습시키는 선행 multi-teacher 접근과 달리, 여기서는 특화를 두 개의 넓은 능력 도메인으로 조직한다. 예비 평가에 따르면 많은 세분 도메인마다 교사를 독립 학습시키는 것은 상당한 RL·인프라 비용을 유발하면서 이 설정에서는 추가 이득이 제한적이었다. 두 전문가 설계가 특화 품질·학습 비용·증류 복잡도 사이에서 유리한 균형을 이룬다.
OPD의 핵심 난제는 학생과 교사 사이의 분포 불일치다. 교사가 학생이 샘플링한 prefix 위에서 평가되므로, 정책 격차가 크면 학생 궤적이 교사의 신뢰할 수 있는 support 밖으로 떨어져 잡음이 많거나 무의미한 지도가 된다. 이 설정에서는 두 전문가 정책이 같은 SFT 체크포인트에서 파생되므로 생성 거동이 대체로 호환된다. 초기 격차를 더 줄이기 위해 Nemotron 3 Ultra의 warmup 전략을 따른다. 두 전문가로 고품질 궤적을 생성해 원래 SFT 모델에 경량 SFT warmup을 수행하고, 그 체크포인트를 OPD의 초기 학생으로 삼는다.
이 목적은 학생 자신이 유도한 상태 위에서 다음을 최소화하는 것과 동치다.
희소한 궤적 수준 reward에 기반한 RL 목적과 달리, OPD는 생성된 궤적 전반에 걸쳐 해당 전문가로부터 조밀한 토큰 수준 지도를 제공한다.
기존 OPD 시스템은 모든 토큰 위치에서 교사의 전체 분포나 top-k 근사를 전송하기도 한다. 그러나 최대 시퀀스 길이 256K 토큰에서는 그 통신·저장 비용이 상당해진다. full-vocabulary logit은 물론 top-64 교사 logit만 보내도 교사 채점 워커와 learner 워커 사이에 큰 통신 부하가 생긴다. 이 설정의 교사들은 같은 SFT 기원을 공유하고 warmup이 학생과의 정책 격차를 더 줄여 주므로, 샘플링된 토큰의 교사 log-probability만 전송해도 안정적 증류에 충분하다. 교사 payload가 O(HV) 또는 O(Hk)에서 O(H)로 줄어든다.
교사가 샘플 토큰에 proximal student보다 높은 확률을 부여하면 advantage가 양수가 되고 그렇지 않으면 음수가 된다. 그에 따라 해당 행동의 확률이 오르거나 내린다.
두 목적의 최적화 형태는 같다. 현재 정책을 detached·clipped behavior-to-current importance weight로 최적화하고, R3 routing 정렬과 BKL 기반 수치 마스킹을 함께 쓴다. 유일한 차이는 advantage다. reasoning RL은 verifier reward·GEPO·adaptive length regularization에서 나온 sequence-level advantage를 쓰고, OPD는 식 (33)의 토큰 수준 교사–학생 log-probability 차이를 쓴다.
과학 능력은 고립된 정답률만으로 평가할 수 없다. 추론을 실행 가능하고 검증 가능하며 반복 가능한 작업 흐름에 연결할 수 있는지가 함께 물어져야 한다.
다양한 생물학적 스케일에 걸친 모델의 서열 이해 능력을 평가하는 multi-omics 벤치마크. 생물 서열 기반 예측 과제와 고급 추론 요구를 통합해 복잡한 genomic·transcriptomic·proteomic 데이터의 해석을 요구한다.
molecule-oriented, protein-oriented, biomolecular text-oriented 세 범주로 특화 LLM 학습의 공백을 메운다. 복잡한 생체분자 구조와 기능 서술을 다루는 능력을 기르는 방대한 instruction-following 쌍을 포함한다.
SMILES로 표현된 분자 그래프 위에서 충실하게 추론하는 능력을 평가한다. 구조적으로 held-out된 849개 분자를 포함하는 5,111개의 기호적으로 검증 가능한 질문을 counting, indexing, constrained-generation 과제군으로 조직한다.
물리·화학·의학 등 총 9개 도메인, 149개 구체 과제에 걸친 과학적 추론을 평가한다. 객관식, 빈칸 채우기, 프로토콜 기반 절차 문항 등 형식이 다른 10개 하위 벤치마크로 지식 인출과 복잡한 연역 추론을 함께 본다.
자연어 지시에 따른 open-domain 분자 생성을 평가한다. 분자 편집, 분자 물성 최적화, 맞춤형 분자 생성 세 과제가 각각 3개 하위 과제로 나뉘고 하위 과제당 5,000개 테스트 샘플을 갖는다.
단위 격자당 최대 20개 원자를 갖는 물질에 대한 조건부 결정 구조 생성 벤치마크. 주기성과 대칭성 같은 물리 제약 아래 조성으로부터 정확한 원자 좌표와 격자 파라미터를 예측한다. 학습 27,136개, 테스트 9,046개 샘플.
생물학적으로 유의미한 9개 표적에 대한 de novo 단백질 binder 설계를 평가한다. 표적마다 사전 정의된 결합 계면을 만족하고 다단계 구조·물리화학 평가 파이프라인을 통과하는 binder를 생성해야 한다. RFdiffusion과 AlphaFold 3 등으로 후보를 생성·평가하고 interface-confidence, binding-energy, molecular-contact 기준으로 다시 평가한다.
극도로 크고 초고해상도인 원격탐사 영상에 초점을 둔다. 16개 하위 과제로 6종의 지각 능력과 4종의 추론 능력을 평가한다.
현미경 기반 연구에 초점을 둔 1,042개 전문가 큐레이션 객관식 문항. 전문가 수준 이미지 이해, 가설 생성, 실험 제안이라는 세 추론 능력을 평가한다.
5개 고가치 과학 분야, 66개 멀티모달 과제에 걸친 830개 검증 VQA 쌍. 실제 원시 과학 데이터 형식을 활용해 지각·이해·고급 추론 능력을 탐침한다.
다분광 위성 관측과 선택적 기상관측소 측정으로부터 극한 기상·지구물리 위기를 추론한다. 127개 사건, 8개 재난 범주, 61개국을 아우르는 4,202개 VQA 샘플. 조기 경보, 사건 유형·시점 예측, 영향 평가, 사후 복구 분석을 다룬다.
관용적 알고리즘 연습이 아니라 현실적 과학 연구 문제에 대해 실행 가능한 코드를 작성하는 능력을 평가한다. 물리·수학·재료·생물·화학 등 16개 세부 분야의 80개 주 문제를 338개 하위 문제로 분해했다.
Practical Inquiry Model이 정의하는 탐구 주기 전체 — deliberation, conception, action, perception — 에 걸친 과학 일반 지능을 평가한다. 10개 과학 도메인, 75개 연구 방향의 전문가 큐레이션 1,263개 샘플.
자율 에이전트가 원시 데이터와 관련 문헌에서 출발해 출판 수준의 연구 보고서까지 end-to-end 연구를 수행할 수 있는지 평가한다. 10개 과학 도메인의 실제 논문에서 도출한 40개 과제이며 평가 중 대상 논문은 감춘다. ResearchHarness v0.0.49에서 평가했다.
선택지 수를 늘리고 추론 집약적 문항에 집중해 원래 MMLU를 강화했다.
검색 도구 없이 short-form 사실성과 파라미터 지식을 평가한다. 중복 제거, 주제 균형, 출처 조정, 모호성 제거, 적대적 난도 필터링을 거친 1,000개 사람 검증 프롬프트.
복잡한 단일 턴 지시, 다중 턴 문맥 유지, system-prompt 조종 가능성 아래의 고급 instruction following을 평가한다. 최대 20개의 독립 검증 가능한 기준과 짝지어진 1,645개 프롬프트이며 모든 해당 기준을 만족해야 성공으로 친다.
2026년 2월 Harvard–MIT Mathematics Tournament의 33개 문제. 대회 직후 평가되었으므로 경쟁 수준 수학 문제 해결에 대한 비교적 신선한 테스트이기도 하다.
MMMU의 견고한 확장판. 고해상도 이미지와 특화 지식을 활용해 전문 도메인 전반의 전문가 수준 이해와 복잡한 추론을 강조한다.
현실적 차트에 대한 시각 지각과 복잡한 추론을 평가한다. 99개 출처에서 수집한 1,341개 차트와 1,948개 질문. 대시보드, 인포그래픽, 지도, 막대·선 그래프 등 이질적 차트 유형을 포함한다.
절차적 지식을 구조화한 패키지가 LLM 에이전트의 성능을 높이는지 평가한다. 8개 도메인 87개 과제이며 Skills 유무의 대조 평가로 절차적 안내의 기여를 분리한다. OpenClaw 2026.5.7에서 평가했다.
격리된 커맨드라인 환경에서 실행되는 89개의 어렵고 현실적인 과제. 2.0의 28개 과제를 개정하고 지속 검증을 도입했다. Terminus 2에서 평가했다.
수 시간에서 수일의 전문 작업을 요구할 수 있는 장기 지평·기업 지향 소프트웨어 공학 과제. 41개 활성 저장소에서 나온 1,865개 사람 검증 문제. Mini-SWE-Agent에서 평가했으며 에이전트가 git log로 정답을 얻지 못하도록 공식 평가 이미지를 수정했다.
Python을 넘어 C, C++, Go, Java, JavaScript, TypeScript, PHP, Ruby, Rust 9개 언어, 42개 저장소의 300개 수작업 큐레이션 과제로 확장했다. Mini-SWE-Agent에서 평가했다.
실제 CLI harness 환경에서 복잡한 장기 지평 과제에 대해 자율 에이전트를 평가하는 native-runtime 벤치마크. 사람이 작성한 이중언어·멀티모달 워크플로를 실제 도구·환경과 결합한다.
Table 2 — 과학 벤치마크 성능 비교 · ■ 전체 최고 밑줄 오픈소스 최고
| Benchmark | Description | Intern-S2- Preview-397B | Qwen3.5- 397B-A17B | DeepSeek- V4-pro | Kimi- K2.7-Code | GLM-5.2 | GPT-5.5 | Gemini- 3.1-Pro | Claude- Opus-4.8 |
|---|---|---|---|---|---|---|---|---|---|
| Biology-Instructions | Multi-omics Sequence Analysis | 56.92 | 4.49 | 9.14 | 7.68 | 6.34 | 10.52 | 13.87 | 6.78 |
| Mol-Instructions | Bio-molecular Instruction | 52.37 | 11.65 | 12.06 | 24.56 | 19.58 | 40.49 | 38.84 | 38.35 |
| MolecularIQ | Molecular Structure Reasoning | 61.49 | 41.48 | 44.43 | 52.81 | 60.91 | 76.41 | 38.94 | 66.78 |
| SciReasoner | Scientific Reasoning | 63.97 | 45.02 | 51.11 | 51.69 | 51.45 | 61.15 | 60.35 | 58.00 |
| TOMG-Bench | Molecule Generation | 65.66 | 54.06 | 57.63 | 58.28 | 57.89 | 69.89 | 62.67 | 61.38 |
| MP20 | Material Structure Generation | 67.88 | 6.15 | 6.75 | 8.40 | 1.50 | 16.12 | 16.75 | 15.60 |
| ProteinBinder-9 | Biomolecular Interaction Design | 4.36 | 1.64 | 1.88 | 1.92 | 2.01 | 2.13 | 2.21 | 2.40 |
| MultiModal Tasks | |||||||||
| XLRS-Bench | Remote Sensing | 51.97 | 50.11 | – | 49.90 | – | 50.96 | 54.27 | 51.84 |
| MicroVQA | Biological Microscopy VQA | 68.81 | 68.71 | – | 61.04 | – | 63.63 | 71.02 | 61.80 |
| SFE | Scientific Multimodal Tasks | 61.67 | 62.97 | – | 50.76 | – | 52.09 | 59.57 | 59.08 |
| ObsCrisis-Bench | Extreme Weather Analysis | 26.07 | 19.22 | – | 32.63 | – | 28.33 | 25.71 | 24.24 |
| Agentic Tasks | |||||||||
| SciCode | Agentic Scientific Coding | 49.11 | 46.35 | 47.53 | 43.49 | 51.97 | 55.92 | 54.44 | 56.21 |
| SGI-Bench | Scientific Agent Interaction | 49.37 | 44.44 | 45.70 | 50.63 | 52.41 | 42.77 | 45.28 | 49.06 |
| ResearchClawBench | Automated Research | 18.44 | 15.86 | 13.69 | 15.40 | 23.35 | 17.00 | 14.54 | 21.74 |
Table 3 — 범용 벤치마크 성능 비교
| Benchmark | Description | Intern-S2- Preview-397B | Qwen3.5- 397B-A17B | DeepSeek- V4-pro | Kimi- K2.7-Code | GLM-5.2 | GPT-5.5 | Gemini- 3.1-Pro | Claude- Opus-4.8 |
|---|---|---|---|---|---|---|---|---|---|
| MMLU Pro | Knowledge & Reasoning | 89.75 | 87.80 | 86.86 | 87.10 | 87.22 | 88.20 | 91.00 | 90.12 |
| SimpleQA-Verified | Factual Question Answering | 69.90 | 54.80 | 46.60 | 38.60 | 37.90 | 64.30 | 75.60 | 43.30 |
| AdvancedIF | Instruction Following | 74.44 | 75.49 | 73.83 | 76.17 | 75.76 | 76.20 | 79.78 | 72.88 |
| HMMT-2026 | High School Math Competition | 91.57 | 87.88 | 91.76 | 90.34 | 92.50 | 97.06 | 94.70 | 95.36 |
| MultiModal Tasks | |||||||||
| MMMU Pro | Knowledge & Reasoning | 80.46 | 80.29 | – | 77.92 | – | 81.68 | 83.99 | 76.88 |
| ChartQAPro | Chart Question Answering | 69.65 | 68.61 | – | 54.86 | – | 69.23 | 71.18 | 58.65 |
| Agentic Tasks | |||||||||
| SkillsBench | Skill usage in Harness | 50.03 | 35.58 | 49.53 | 55.63 | 53.19 | 49.59 | 37.20 | 54.40 |
| TerminalBench 2.1 | Terminal Mastery | 67.42 | 51.30 | 64.00 | 66.29 | 77.90 | 79.40 | 73.80 | 84.60 |
| SWE-Bench-Pro | Software Engineering | 61.56 | 43.55 | 55.40 | 57.59 | 62.10 | 58.60 | 54.20 | 69.20 |
| SWE-Bench-Multilingual | Software Engineering | 81.67 | 65.00 | 72.44 | 78.56 | 82.00 | 73.33 | 44.00 | 77.00 |
| WildClawBench | Real-World Agent Tasks | 44.68 | 34.50 | 43.70 | 46.89 | 54.20 | 58.20 | 40.80 | 64.72 |
Intern-S2-Preview-397B는 폭넓은 과학 벤치마크에서 선도적 성능을 보인다. Biology-Instructions(56.92), Mol-Instructions(52.37), SciReasoner(63.97)에서 강력한 오픈·클로즈드 모델을 모두 앞선다. 내부 평가 세트인 MP20과 ProteinBinder-9에서도 SOTA를 기록한다. MolecularIQ(61.49), TOMG-Bench(65.66), XLRS-Bench(51.97), MicroVQA(68.81)에서는 오픈소스 모델 중 최고다.
과학 지향 에이전틱 과제에서는 대체로 DeepSeek-V4-Pro와 Qwen3.5-397B를 앞서며 GLM-5.2에만 뒤진다. 범용 벤치마크에서도 강하다. MMLU-Pro(89.75), SimpleQA-Verified(69.90), MMMU-Pro(80.46), ChartQAPro(69.65)에서 오픈소스 최고 성적을 낸다. 범용 에이전틱 과제에서는 Qwen3.5-397B를 일관되게 앞서고 Kimi-K2.7-Code에 견줄 만한 성능을 보인다.
Biology-Instructions와 MP20의 격차는 다른 벤치마크와 성격이 다르다. 경쟁 모델 대부분이 한 자릿수에 머무는 영역에서 50~60점대를 낸다는 것은 일반 능력의 우열이 아니라 특화 데이터와 modality 처리 경로의 유무가 만든 차이에 가깝다. 반대로 TerminalBench나 WildClawBench 같은 범용 에이전틱 과제에서는 상위 클로즈드 모델과의 간격이 남아 있다.
Memory Decoder를 397B의 별도 확장으로 평가하기 위해 생물학을 대표 과학 도메인으로 골라 Intern-MemDec-4B를 구성했다. 그 결과 메모리를 21개 Biology-Instructions 과제 전체에서 평가하고, MMLU Pro, Mol-Instructions, MMMU Pro, MicroVQA, IMO-Answer-Bench, SFE에서 도메인 밖 거동을 점검했다. 참조 모델로 Intern-S1-Pro(1T)를 함께 놓았다.
Figure 12(a) — Biology-Instructions 21개 과제별 결과
| BioIns Task | w/o MemDec | w/ MemDec-4B | Δ |
|---|---|---|---|
| DNA-cpd | 63.11 | 72.57 | +9.46 |
| DNA-emp | 19.95 | 27.25 | +7.30 |
| DNA-enhancer activity | 53.68 | 60.71 | +7.03 |
| DNA-pd | 84.40 | 89.12 | +4.72 |
| DNA-tf-h | 56.57 | 55.99 | −0.58 |
| DNA-tf-m | 56.96 | 67.09 | +10.13 |
| Multi-sequence antibody-antigen | 40.24 | 36.44 | −3.80 |
| Multi-sequence promoter-enhancer interaction | 22.46 | 38.47 | +16.01 |
| Multi-sequence RNA-protein interaction | 84.74 | 87.34 | +2.60 |
| Multi-sequence siRNA efficiency | 63.05 | 60.63 | −2.42 |
| Protein-Fluorescence | 70.48 | 72.23 | +1.75 |
| Protein-FunctionEC | 61.88 | 60.10 | −1.78 |
| Protein-Solubility | 68.60 | 68.00 | −0.60 |
| Protein-Stability | 69.67 | 67.80 | −1.87 |
| Protein-Thermostability | 58.44 | 53.97 | −4.47 |
| RNA-CRISPROnTarget | 6.61 | 17.18 | +10.57 |
| RNA-Isoform | 82.65 | 84.81 | +2.16 |
| RNA-MeanRibosomeLoading | 56.20 | 59.71 | +3.51 |
| RNA-Modification | 59.64 | 60.48 | +0.84 |
| RNA-NoncodingRNAFamily | 78.80 | 85.70 | +6.90 |
| RNA-ProgrammableRNA Switches | 37.13 | 41.23 | +4.10 |
| AVG score | 56.92 | 60.32 | +3.40 (+6.0%) |
21개 중 14개 과제가 개선되고 7개가 하락했다. 평균은 56.92에서 60.32로 올라간다. 도메인 밖 프로필은 생물학 메모리가 표적 도메인 바깥의 거동을 바꾸는지 확인하는 용도다. 이 비교에서 Intern-MemDec-4B는 일반 지식·추론·과학·멀티모달 벤치마크에서 동결된 백본에 근접한 채로 표적 생물학 벤치마크만 개선한다. Memory Decoder가 397B 백본의 선택적 확장으로서 표적화된 과학 특화를 제공할 수 있다는 뜻이다.
Table 4 — SciTS 시계열 이해 (F1, 높을수록 좋음)
| Model | ASU01 | ASU03 | BIU01 | BIU03 | EAU01 | MEU01 | NEU06 | PHU01 | PHU04 | RAU01 | RAU02 | |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| TEXT | GPT-4.1-mini | 67.2 | 15.6 | 0.2 | 12.7 | 67.0 | 44.0 | 16.1 | 24.0 | 52.7 | 24.6 | 10.6 |
| Gemini2.5-Flash | 64.1 | 16.3 | 1.5 | 12.4 | 67.6 | 60.9 | 5.8 | 20.7 | 64.8 | 20.9 | 13.5 | |
| DeepSeek-V3 | 1.1 | 12.3 | 0.0 | 5.8 | 40.2 | 59.3 | 13.6 | 28.9 | 50.7 | 19.4 | 4.2 | |
| VL | GPT-5-mini | 65.7 | 18.9 | 0.8 | 17.9 | 67.6 | 30.4 | 13.3 | 21.4 | 47.8 | 24.3 | 9.1 |
| Gemini2.5-Flash | 61.6 | 15.2 | 0.9 | 8.3 | 72.5 | 64.1 | 11.6 | 22.7 | 59.0 | 31.6 | 11.3 | |
| Intern-S1-Pro | 98.0 | 75.9 | 20.8 | 88.3 | 99.5 | 65.6 | 71.3 | 36.8 | 93.2 | – | – | |
| Intern-S2-Preview-397B | 97.1 | 91.0 | 36.5 | 98.3 | 100.0 | 81.8 | 70.2 | 66.9 | 99.9 | 88.4 | 60.2 |
Intern-S2-Preview는 범용 Text LLM과 Vision-Language LLM을 일관되게 앞선다. 텍스트 서술이나 시각화된 신호에만 기대는 대신 기저 시계열을 직접 모델링하는 것이 중요하다는 점을 보여준다. 더 중요한 것은 조 단위 파라미터 규모인 Intern-S1-Pro의 절반이 안 되는 파라미터로 동등하거나 더 나은 성능을 낸다는 사실이다. 두 모델이 공통 지원하는 9개 과제 중 7개에서 앞선다. ASU03, BIU01, BIU03, MEU01, PHU01에서 개선이 특히 두드러지고, PHU01의 F1은 36.8에서 66.9로 오른다. 업그레이드된 모듈은 Intern-S1-Pro가 지원하지 못하던 레이더 coding-scheme 분류와 mode-and-modulation 분류(RAU01·RAU02)까지 확장되며 두 과제 모두 베이스라인보다 크게 앞선다.
Table 5 — SciTS 시계열 예측, MAPE (success rate %) · MAPE는 낮을수록, success rate는 높을수록 좋음
| Model | ENG02 | ENG03 | MEG03 | NEG03 | PHG02 | URG01 | URG05 | |
|---|---|---|---|---|---|---|---|---|
| TEXT | GPT-4.1-mini | 125.0 (1.4) | 8.3 (96.0) | 42.1 (49.6) | 95.2 (96.4) | 1.1e3 (94.2) | 320.6 (18.6) | 126.6 (100) |
| Gemini2.5-Flash | 72.5 (5.9) | 9.6 (99.0) | 62.2 (57.9) | 63.5 (99.2) | 110.8 (99.0) | 246.0 (23.3) | 98.6 (100) | |
| DeepSeek-V3 | 117.2 (46.1) | 7.7 (98.0) | 46.4 (30.9) | 4.3 (3.1) | 200.1 (92.2) | 350.0 (18.6) | 296.7 (93.0) | |
| VL | GPT-5-mini | 56.1 (4.5) | 11.2 (76.0) | 37.6 (51.8) | 74.3 (97.2) | 155.3 (97.4) | 182.1 (58.1) | 71.1 (72.9) |
| Gemini2.5-Flash | 103.9 (7.4) | 15.6 (53.0) | 53.1 (37.2) | – | 185.2 (36.9) | 351.9 (16.3) | 114.6 (91.2) | |
| TS | Moirai-Large | 121.2 (100) | 12.8 (100) | 51.7 (100) | 59.1 (100) | 116.9 (100) | 294.7 (100) | 74.6 (100) |
| TimeMoE-Large | 70.4 (100) | 11.6 (100) | 39.0 (100) | 70.1 (100) | 80.2 (100) | 218.4 (100) | 84.4 (100) | |
| Chronos-bolt-Base | 73.7 (100) | 12.0 (100) | 41.5 (100) | 78.5 (100) | 109.3 (100) | 139.3 (100) | 70.6 (100) | |
| UniTS | 70.1 (100) | 12.8 (100) | 42.0 (100) | 95.2 (46.4) | 135.9 (44.1) | 389.7 (100) | – | |
| TimeOmni | 68.6 (100) | 7.4 (100) | 37.5 (100) | 78.7 (100) | 163.0 (100) | 247.0 (100) | 174.0 (100) | |
| Intern-S2-Preview-397B | 60.2 (100) | 7.1 (100) | 32.8 (100) | 59.2 (100) | 72.2 (100) | 138.9 (100) | 60.6 (100) |
Text·Vision-Language LLM은 성공률 자체가 낮은 경우가 많다. 긴 예측 지평이 출력 용량을 넘어설 수 있고, 엄격한 시퀀스 길이·형식 요구가 instruction-following 실패로 이어지기 때문이다. 게다가 discrete text token으로 예측을 생성하면 수치 정밀도가 훼손되어 미세한 과학 신호에서 정확도가 제한된다. 전용 numerical forecasting branch를 쓴 397B는 수치 충실도를 지키면서 이질적 도메인과 예측 지평 전반에서 신뢰할 만한 예측을 수행한다. ENG02, ENG03, MEG03, PHG02, URG05에서 특화 시계열 베이스라인 대비 이득이 뚜렷하다. horizon predictor의 정확도는 99%다. SciTS 밖에서는 일반 시계열 예측 벤치마크 GIFT-Eval에서 zero-shot MASE 0.785라는 경쟁력 있는 값을 낸다.
DeepSeek-V3의 NEG03 MAPE 4.3은 표에서 가장 낮은 값이지만 success rate가 3.1%다. 즉 거의 모든 사례에서 형식·길이 요구를 만족하지 못했고, 통과한 소수 사례만 집계된 수치다. 이런 표에서는 오차값과 성공률을 반드시 함께 읽어야 한다.
Intern-S2-Preview-397B는 멀티모달 이해, 도메인 특화 추론, 과학적 생성, 도구 상호작용, 반복 실행을 요구하는 과학 연구를 위한 과학 에이전틱 파운데이션 모델로 제시되었다. 과학·멀티모달·에이전틱·범용·시계열 평가 전반에서 모델은 폭넓은 능력 범위를 보이며 아키텍처, 사전학습, 후속학습의 주요 설계 선택을 뒷받침한다.
별개로 Memory Decoder 연구는 동결된 백본에 표적화된 과학 특화를 더하면서도 397B를 일반 모델로 유지할 수 있음을 보여준다. Intern-S2-Preview는 여전히 preview 시스템이다. 저자들이 스스로 꼽는 향후 과제는 네 가지다. 더 긴 과학 워크플로에서의 신뢰성 개선, 도메인 특화 메모리와 task 환경의 확장, verifier 강화, 그리고 특화된 과학 도구와의 통합 심화.
원 보고서의 참고문헌은 112편이다. 아래는 본문 서술에 직접 관여한 항목만 추린 것이다.
[12] Cao et al. Memory Decoder: A Pretrained, Plug-and-Play Memory for Large Language Models. NeurIPS 2025.
[84] Wei et al. Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory. 2026.
[83] Wei et al. MLP Memory: A Retriever-Pretrained Memory for LLMs. ICLR 2026.
[78] Wang et al. MemSFT: Mitigating Alignment Tax with an External Parametric Memory. 2026.
[40] Khandelwal et al. Generalization through Memorization: Nearest Neighbor Language Models. 2019.
[100] Zhang et al. Scalable Visual Pretraining for Language Intelligence. 2026.
[109] Zhao et al. Exploring Visual Pretraining for Learning Language Intelligence. CVPR 2026.
[76] Wang et al. MinerU2.5-Pro: Data-Centric Document Parsing at Scale. 2026.
[64] Schick et al. Toolformer: Language Models Can Teach Themselves to Use Tools. 2023.
[88] Xing et al. CapRL: Stimulating Dense Image Caption Capabilities via RL. ICLR 2026.
[112] Zou et al. Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale. 2026.
[8] Bai et al. Intern-S1: A Scientific Multimodal Foundation Model. 2025.
[55] MiniMax. MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention. 2025.
[52] Ma et al. Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers (R3). 2025.
[44] Li et al. Ling and Ring 2.6 Technical Report (KPop). 2026.
[95] Yang et al. Gated Delta Networks: Improving Mamba2 with Delta Rule. ICLR 2025.
[63] Samarin et al. LK Losses: Direct Acceptance Rate Optimization for Speculative Decoding. 2026.
[14] Chen et al. Accelerating LLM Decoding with Speculative Sampling. 2023.
[43] Leviathan et al. Fast Inference from Transformers via Speculative Decoding. ICML 2023.
[21] Cheng et al. Group Entropy-Controlled Policy Optimization (GEPO). 2026.
[96] Yu et al. DAPO: An Open-Source LLM Reinforcement Learning System at Scale. 2025.
[65] Shao et al. DeepSeekMath: Pushing the Limits of Mathematical Reasoning. 2024.
[39][48] Jordan et al. / Liu et al. Muon Optimizer & Muon is Scalable for LLM Training.
[56] NVIDIA. Nemotron 3 Ultra. 2026.
[71] Tang et al. Skill2Task: Self-Evolving Agentic Task Synthesis via Skills Graph. 2026.
[70] Tang et al. SciExplore: Evaluating Autonomous Agents from Scientific Navigation to Information Integration. ACL 2026.
[92] Yang et al. SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering. 2024.
[79] Wang et al. OpenHands: An Open Platform for AI Software Developers as Generalist Agents. ICLR 2025.
[47] Lightman et al. Let's Verify Step by Step. ICLR 2024.
[86] Wu et al. SciTS: Scientific Time Series Understanding and Generation with LLMs. ICLR 2026.
[34] He et al. Biology-Instructions. EMNLP Findings 2025.
[99] Zhang et al. ODesign: A World Model for Biomolecular Interaction Design. 2025.
Intern-S2-Preview Team, Shanghai AI Laboratory. Intern-S2-Preview: Scientific Agentic Foundation Model. arXiv:2608.13505v1 [cs.LG], 2026-08-13. 모델은 huggingface.co/internlm/Intern-S2-Preview에서, agentic RL 프레임워크는 github.com/InternLM/xtuner에서 공개되어 있다.