장기기억은 공짜가 아니다상태·문맥·안정성의 비용
New Bounds for Mamba and Efficient Sequence Models
핵심 변화는 “메모리가 일정하다”는 구현 문장을 “어떤 정확도에서 얼마의 상태·문맥·안정성 여유가 필요한가”라는 측정 가능한 질문으로 바꾸는 것이다.
고정 크기 순환 상태는 문맥 길이에 따라 저장공간이 늘지 않는다는 뜻이지, 임의로 먼 과거를 임의의 정확도로 보존한다는 뜻이 아니다.
새 이론은 장기기억을 형용사가 아니라 자원 함수로 만든다. 대수적으로 감쇠하는 예측 기억에서 상태 수, 문맥 길이, 수축 안정성이 정확도와 어떻게 교환되는지를 정량화한다. 동시에 새로운 Mamba 응용 두 편은 성공적인 설계가 “Mamba만 사용”하는 것이 아니라, 공간 방향·시간 척도·도메인 선험을 구조화한다는 점을 보여준다.
읽기 전제. 이 글은 전일 종합 분석의 후속편이다. LFM은 Liquid AI의 모델군, Mamba는 선택적 상태공간 아키텍처이며 둘을 동일시하지 않는다. 이번 조사에서 새로운 LFM 기술보고서는 확인되지 않아, LFM2 구조를 다른 세대에 소급하지 않는다.
PART 01 · DEFINITION
장기기억을 “예측에 유용한 과거의 영향”으로 정의하기
확인된 사실 새 이론은 장기기억을 모든 과거 토큰의 완전 복원이 아니라, 과거가 미래 예측위험에 기여하는 predictive-memory law로 정의한다. 대표 표적은 영향이 지연 j에 대해 j−α처럼 대수적으로 감소하는 과정이다. [2]
Mamba의 선택적 SSM은 여전히 hₜ = Āₜhₜ₋₁ + B̄ₜxₜ, yₜ = Cₜhₜ로 이해할 수 있다. 입력별 선택성은 기억·망각·읽기를 조절하지만 추론 중 가중치를 학습한다는 뜻은 아니다. 이번 결과가 더하는 것은 상태의 크기와 기억의 정확도를 분리해 말해야 한다는 정량적 언어다.
PART 02 · PROBLEM DEFINITION
최대 품질이 아니라 제약 아래의 기억 효용
실용 문제는 다음 다목적 설계로 정식화할 수 있다.
subject to p95 latency ≤ ℓ, peak memory ≤ M, energy/success ≤ E, recovery risk ≤ R
편집 해석 여기서 고정 상태는 peak memory를 낮추는 하나의 수단일 뿐이다. 상태를 너무 압축하면 정확 회수가 깨지고, 임계점에 지나치게 접근하면 양자화·잡음·세션 드리프트에 민감해질 수 있다. 반대로 full attention은 긴 문맥을 직접 노출하지만 prefill 연산이 길이에 대해 이차이고 KV cache는 선형으로 증가한다. GQA는 계수를 줄일 뿐 길이 의존성을 제거하지 않는다.
따라서 비교 단위는 “아키텍처 이름”이 아니라 동일 데이터·정밀도·하드웨어에서의 성공 작업당 자원과 오류 복구율이어야 한다.
PART 03 · CORE CONCEPTS
세 개의 자원 법칙과 한 개의 중요한 경계
1. 상태 수와 오차
특정 대수 기억 표적에 대해 최선의 (r)-모드 예측 오차는 위·아래 경계가 모두 다음 꼴이다.
정확도를 높일수록 필요한 상태는 무한히 커질 수 있으나, 그 증가는 오차 역수의 제곱로그다. 이는 “작은 상태가 쓸모없다”가 아니라 정확도 목표를 명시해야 상태 예산을 논할 수 있다는 뜻이다.
2. 문맥 길이와 예측 격차
FARIMA 계열의 분수 장기기억에서는 유한 문맥 (L)의 예측위험 격차가 정확한 선도항 (V_L−V_∞ = V_∞d²/L + o(L^{-1}))을 갖는다. 단순 계수 꼬리 합이 아니라 분수 적분 뒤의 예측 기하에서 나온다. [2]
3. 수축과 임계성
균일 수축률 ρ<1인 비선형 문맥 순환모델은 첫 번째 Wiener chaos에서 지수 감쇠 외피를 갖는다. 대수 표적의 오차를 0으로 보내려면 ρ가 1에 가까워져야 한다. 그러나 임계점 접근은 필요조건이지 충분조건이 아니다.
4. 적용 경계
확인된 사실 논문 스스로 이 정리가 특정 스칼라 표적, 유한상태·지수 모드 클래스, 균일 수축과 미분 예산에 한정된다고 밝힌다. 선택적 또는 비수축 아키텍처는 범위 밖일 수 있다. 따라서 “Mamba가 log² 상태를 반드시 필요로 한다”거나 “LFM2가 이 하한을 따른다”는 주장은 성립하지 않는다.
PART 04 · INTRODUCTION
효율적 연산자에서 기억 자원 과학으로
2023–2025년의 질문이 “attention을 선형시간 연산자로 대체할 수 있는가”였다면, 2026년의 질문은 “그 압축 상태가 어떤 기억법칙을 얼마의 정확도로 보존하는가”로 이동하고 있다. 전일 글이 기억 회수·상태 추적·하드웨어 공동 설계를 연결했다면, 이번 근거는 그 가운데 회수 정확도와 안정성의 가격표를 제시한다.
| 새 근거 | 최초 공개 / 개정 | 이번에 추가되는 지식 | 과잉해석 방지 |
|---|---|---|---|
| Cost of Long Memory | 2026-09-24 · v1 | 상태·문맥·임계성의 자원 법칙 | 특정 예측 표적과 모델 클래스 |
| GeoPrior-Mamba | 2026-10-07 · v1 | 공간방향 Mamba+구조화 과정 선험 | OCO-2/TCCON 조건의 저자 보고 |
| HAN-Mamba | 2026-10-07 · v1 ICAART 2026 개정선정 논문 | 다중 시간척도 Mamba+3-token attention fuser | Optiver 단일 benchmark |
| Scaling Legal AI | 2025-08-29 · v2 2026-10-07 | 공유 pipeline의 Mamba/Transformer 비교 | seed 분산·유의성 검정 없음 |
PART 05 · MOTIVATION AND BACKGROUND
왜 “O(1) 상태”만으로는 충분하지 않은가
순수 고정상태 SSM의 순환 상태 메모리가 시퀀스 길이와 독립이라는 주장은 구현 자원에 관한 말이다. 정보이론적 용량이나 임의 지연의 완전 회수 보장은 아니다. 새 이론은 이 구분을 예측위험으로 정교화한다.
LFM2는 입력 의존 게이트 단거리 합성곱과 일부 GQA를 결합한다. 그러므로 전체 모델을 순수 SSM의 O(1) 상태 또는 완전 선형 모델로 분류할 수 없다. 이번 조사에서 LFM2 이후의 새 학술 기술보고서는 확인되지 않았으며, 제품 발표와 모델카드는 논문 근거와 분리해야 한다.
편집 해석 Mamba와 LFM 계열의 공통 연구동기는 “모든 과거를 저장”하는 것이 아니라 과제 성공에 필요한 증거·상태·예외를 제한된 예산으로 유지하는 것이다. 이 관점은 압축 상태와 선택적 attention, 외부 메모리를 경쟁재가 아니라 보완재로 만든다.
PART 06 · CHALLENGES
정량 법칙이 드러내는 여섯 난제
- 정확 회수와 압축: 작은 상태는 평균 예측에는 충분해도 희귀한 키–값 회수에는 실패할 수 있다.
- 기억과 상태 추적: 오래된 사실 보존과 최신 상태 덮어쓰기는 반대되는 동작을 요구한다.
- 임계성과 수치 안정성: ρ→1은 긴 영향경로를 만들지만 저정밀 누적오차와 reset 정책을 더 중요하게 만든다.
- 학습 길이 밖 일반화: 법칙상 가능성과 실제 최적화·데이터 curriculum의 성공은 다르다.
- 인과 분해: 데이터, 증류, 도메인 선험, 구조, 커널 최적화의 효과가 뒤섞인다.
- 실제 실행 격차: FLOP·선형 복잡도가 CPU/GPU/NPU의 p95 지연·전력·열 throttling을 대신하지 못한다.
특히 GeoPrior-Mamba는 언어모델을 수치 예측 루프 밖에서 선험 표를 구성하는 데 쓰고, HAN-Mamba는 긴 스트림에 Mamba를 쓰되 세 토큰 융합에는 attention을 남긴다. 성공 사례 자체가 순수주의보다 구조화와 배치가 중요함을 시사한다.
PART 07 · RESEARCH QUESTIONS
새 근거가 여는 검증 가능한 질문
| 연구 질문 | 최소 비교 | 핵심 지표 |
|---|---|---|
| RQ1. 같은 메모리에서 어떤 정보를 상태로 남길 것인가? | 사실 회수·상태 추적·희귀 이벤트를 분리 | 근거 회수율, state F1, calibration |
| RQ2. 최소 attention 비중과 배치는? | 순수 SSM, local/hybrid, 외부 메모리 | 품질–p95–peak memory Pareto |
| RQ3. 상태 수 법칙이 selective SSM에도 나타나는가? | 수축률·선택 게이트·상태 차원 factorial sweep | 오차 기울기, effective rank |
| RQ4. 임계점 접근은 저정밀에서 안정한가? | FP16/INT8/INT4, 길이·reset 간격 변화 | drift, overflow, 회복시간 |
| RQ5. 합성 state-tracking이 agent 성공을 예측하는가? | 합성 parity/recall과 장기 실제 작업 공동 측정 | 상관·실패 예측·오류복구율 |
| RQ6. 선험 지식의 기여는 무엇인가? | 동일 backbone·데이터에서 prior/adapter 제거 | 표본효율, OOD, 수렴시간 |
| RQ7. 실제 단말에서 성공 작업당 에너지는? | 동일 양자화·batch·thermal state | J/success, p95, peak RSS |
PART 08 · APPROACHES (METHODS)
정리–아키텍처–응용을 연결하는 방법
A. 목표 기억법칙을 먼저 측정
지연별 예측 기여가 지수 감쇠인지, 멱법칙인지, 사건 기반인지 추정한다. 그 뒤 상태 차원 (r), 문맥 (L), 수축률 ρ를 공동 sweep한다. 이론의 실험은 contractive diagonal SSM, bounded gated recurrence, attention을 정리와 맞춘 합성 표적에서 비교했다. 이는 실제 언어모델 순위를 정하기 위한 실험이 아니다. [2]
B. 방향·척도·선험을 구조화
GeoPrior-Mamba는 다방향 Mamba에 지리·생태·배출·계절 정보를 이용한 결정론적 과정 선험 표를 경량 adapter로 주입한다. 저자들은 OCO-2 2018–2020 held-out에서 RMSE 0.81 ppm, R² 0.93을 보고하며, 동일 프로토콜에서 CAMS 보간 대비 48.2%, Trans-XCO2 대비 3.1% RMSE 감소라고 주장한다. [3]
HAN-Mamba는 단·중·장기 스트림의 attention encoder를 selective Mamba로 바꾸고, 세 스트림 융합에는 3-token attention만 유지한다. Optiver의 시간순 5-fold CV에서 평균 RMSPE 0.1942 대 HAN-T 0.1965, 파라미터 33% 감소, 60→240 bucket 확장 시 0.1927을 보고한다. [4]
C. 공정한 pipeline 비교
법률 벤치마크 v2는 Mamba·SSD-Mamba와 BERT·DeBERTa·Longformer를 공유 windowing·aggregation pipeline으로 비교한다. 저자 보고상 최강 SSM은 최강 Transformer와 약 1.3 percentage point 이내이고 처리량은 DeBERTa의 약 3배, Longformer의 약 4배다. 그러나 random seed 분산과 통계적 유의성 검정이 없어 예비 결과로만 읽어야 한다. [5]
PART 09 · KEY APPLICATIONS
장기기억의 가치는 도메인 구조와 함께 나타난다
| 응용 | 필요한 기억 | 유망한 구성 | 검증 경계 |
|---|---|---|---|
| 위성 CO₂ 재구성 | 공간 방향+계절 과정 | 다방향 Mamba+결정론적 prior adapter | 관측지역·기간 OOD와 물리 일관성 |
| 금융 변동성 | 초 단위 변화+주 단위 regime | 척도별 Mamba+소형 attention fuser | 시장 이동·거래비용·누출 방지 |
| 장문 법률 | 분산된 조문·판례 근거 | SSM 또는 hybrid+명시적 evidence retrieval | 관할권·seed·유의성·인용 정확성 |
| 온디바이스 보조 | 세션 상태와 사용자 의도 | 압축 상태+최근 문맥+외부 증거 | 양자화 drift·privacy·reset |
| ETRI Physical AI | 센서 상태·작업 단계·예외 | 상태 추적+필요 구간 재확인 | 저수준 제어 안전성은 별도 검증 |
연구 제안 로봇 고수준 계획과 설비 운영지능에서는 SSM 상태를 “사실 저장소”로만 쓰지 말고, 현재 작업 상태의 충분통계로 설계한다. 원본 센서 증거는 외부 로그에 남기고, 불확실성이 임계치를 넘을 때만 attention 또는 검색으로 재확인한다.
PART 10 · OPEN PROBLEMS
정리 뒤에도 남는 문제
- 과제별 유한상태 한계: 예측위험 법칙을 정확 토큰 회수·복합 상태 추적으로 어떻게 확장할 것인가?
- 망각 탐지: 상태가 중요한 증거를 잃었다는 사실을 모델 자신이 감지할 수 있는가?
- 장기 세션 drift/reset: 임계성, 저정밀 오차, 분포 변화가 누적될 때 언제 상태를 재구성할 것인가?
- 선택성의 이론: 입력 의존 (Ā_t,B̄_t,C_t)가 고정 모드 하한을 어떤 조건에서 우회하거나 재구성하는가?
- 공정 비교: 동일 데이터·증류·파라미터·양자화·커널·하드웨어 조건의 재현 가능한 평가가 부족하다.
- 실세계 안전: 환경·금융·법률·로봇 응용의 낮은 평균 오차가 위험한 tail event를 보장하지 않는다.
- 한국어 전문업무: 긴 법률·특허·운영기록에서 근거 위치와 결론을 동시에 검증하는 공개 benchmark가 필요하다.
가장 큰 미해결 문제는 “상태가 얼마나 큰가”가 아니라 “상태가 틀렸을 때 언제 알아차리고 원증거로 돌아가는가”다.
PART 11 · FUTURE DIRECTIONS
기억 예산을 동적으로 배분하는 계층형 시스템
창의적 연구 제안 다음 세 층을 결합한다. (1) 매 토큰 갱신하는 저비용 압축 상태, (2) 불확실성·충돌·희귀 사건에서만 여는 제한 구간 attention, (3) 출처와 시점을 보존하는 외부 증거 메모리. 모델은 상태 차원을 무조건 키우지 않고, 예측 잔차와 망각 위험에 따라 기억 예산을 늘린다.
| 단계 | 실험 | 통과 기준 |
|---|---|---|
| 1 · 통제 합성 | 대수/지수/사건 기억, (r,L,ρ), 정밀도 sweep | 오차 법칙·안정성·reset 재현 |
| 2 · 전문업무 | 한국어 법률·특허·설비 로그의 장기 근거 회수 | 근거 회수율·calibration·복구율 |
| 3 · 단말 비교 | 동일 학습데이터·양자화·CPU/GPU/NPU | J/success·p95·peak memory |
| 4 · Physical AI | 상태 오염·통신 단절·센서 누락 | 안전 개입·원증거 복원·rollback |
| 5 · 장기 현장 | 로봇·설비의 주/월 단위 실증 | drift·가동률·오류복구·감사 가능성 |
최종 해석 이번 업데이트가 말하는 방향은 “Mamba 대 Transformer”의 단일 승부가 아니다. 기억법칙을 측정하고, 상태·문맥·안정성·외부 증거에 예산을 배분하며, 실제 성공 작업당 비용으로 검증하는 연구다. LFM과 Mamba의 다음 경쟁력은 연산자 이름보다 이 공동 설계 능력에서 갈릴 가능성이 크다.
PRIMARY SOURCES & LIMITATIONS
출처 URL과 검토 경계
실행일 이후 자료는 포함하지 않았다. 날짜는 arXiv 제출 이력과 공식 학회 기록을 구분했다. 프리프린트 결과는 저자 보고이며 독립 재현하지 않았다. 전일 글과 중복되는 배경 논문은 링크로 대체했다.