SUNGSOO KIM · RESEARCH ESSAYS출처와 검증 범위
LFM · MAMBA · LONG-MEMORY UPDATE

장기기억은 공짜가 아니다상태·문맥·안정성의 비용

New Bounds for Mamba and Efficient Sequence Models

2026-10-09 KST · 전일 종합 글 후속편 · 신규 이론 1건, 신규 응용 2건, 중대 개정 1건

장기기억을 위한 세 가지 자원과 실용적 혼합 설계대수적으로 감쇠하는 예측 기억을 상태 수, 유한 문맥, 임계성으로 근사할 때의 비용과, 이를 상태·선택적 주의·외부 증거 메모리로 조합하는 설계를 나타낸다.상태 / 모드 r오차 ≈ exp(−Θ(√r))목표 τ → r = Θ(log²(1/τ))유한 문맥 L분수 장기기억: gap ≈ C/L더 긴 관측창의 직접 비용안정성 여유오차↓ → 임계점에 접근필요조건이며 충분조건 아님목표 기억법칙과 운영 제약에 따라 자원을 배분정리의 범위: 특정 예측위험·유한상태·균일수축 계열압축 상태 + 필요 구간 attention + 외부 증거 메모리
편집 종합 · 위 식은 Song의 특정 확률 예측 문제에 대한 정리다. Mamba·LFM2 전체의 보편적 하한이 아니며, 선택적·비수축 아키텍처는 정리의 가정 밖일 수 있다. [2]

핵심 변화는 “메모리가 일정하다”는 구현 문장을 “어떤 정확도에서 얼마의 상태·문맥·안정성 여유가 필요한가”라는 측정 가능한 질문으로 바꾸는 것이다.

고정 크기 순환 상태는 문맥 길이에 따라 저장공간이 늘지 않는다는 뜻이지, 임의로 먼 과거를 임의의 정확도로 보존한다는 뜻이 아니다.

새 이론은 장기기억을 형용사가 아니라 자원 함수로 만든다. 대수적으로 감쇠하는 예측 기억에서 상태 수, 문맥 길이, 수축 안정성이 정확도와 어떻게 교환되는지를 정량화한다. 동시에 새로운 Mamba 응용 두 편은 성공적인 설계가 “Mamba만 사용”하는 것이 아니라, 공간 방향·시간 척도·도메인 선험을 구조화한다는 점을 보여준다.

근거 구분. 확인된 사실 서지와 논문 정의. 저자 주장 정리·실험·성능 수치. 편집 해석 여러 결과의 연결. 연구 제안 아직 검증하지 않은 설계다. 모든 실험 수치는 저자 보고이며 독립 재현이 아니다.

읽기 전제. 이 글은 전일 종합 분석의 후속편이다. LFM은 Liquid AI의 모델군, Mamba는 선택적 상태공간 아키텍처이며 둘을 동일시하지 않는다. 이번 조사에서 새로운 LFM 기술보고서는 확인되지 않아, LFM2 구조를 다른 세대에 소급하지 않는다.

PART 01 · DEFINITION

장기기억을 “예측에 유용한 과거의 영향”으로 정의하기

확인된 사실 새 이론은 장기기억을 모든 과거 토큰의 완전 복원이 아니라, 과거가 미래 예측위험에 기여하는 predictive-memory law로 정의한다. 대표 표적은 영향이 지연 j에 대해 j−α처럼 대수적으로 감소하는 과정이다. [2]

Mamba의 선택적 SSM은 여전히 hₜ = Āₜhₜ₋₁ + B̄ₜxₜ, yₜ = Cₜhₜ로 이해할 수 있다. 입력별 선택성은 기억·망각·읽기를 조절하지만 추론 중 가중치를 학습한다는 뜻은 아니다. 이번 결과가 더하는 것은 상태의 크기와 기억의 정확도를 분리해 말해야 한다는 정량적 언어다.

상태 복잡도목표 오차를 위해 필요한 지수 모드 또는 선형 상태 수
문맥 복잡도유한 과거로 무한 과거의 Bayes 위험에 접근하는 속도
안정성 복잡도균일 수축 모델이 목표 정확도에 도달하려면 임계점에 얼마나 가까워져야 하는가

PART 02 · PROBLEM DEFINITION

최대 품질이 아니라 제약 아래의 기억 효용

실용 문제는 다음 다목적 설계로 정식화할 수 있다.

maximize Q(memory, tracking, task)
subject to p95 latency ≤ ℓ, peak memory ≤ M, energy/success ≤ E, recovery risk ≤ R

편집 해석 여기서 고정 상태는 peak memory를 낮추는 하나의 수단일 뿐이다. 상태를 너무 압축하면 정확 회수가 깨지고, 임계점에 지나치게 접근하면 양자화·잡음·세션 드리프트에 민감해질 수 있다. 반대로 full attention은 긴 문맥을 직접 노출하지만 prefill 연산이 길이에 대해 이차이고 KV cache는 선형으로 증가한다. GQA는 계수를 줄일 뿐 길이 의존성을 제거하지 않는다.

따라서 비교 단위는 “아키텍처 이름”이 아니라 동일 데이터·정밀도·하드웨어에서의 성공 작업당 자원과 오류 복구율이어야 한다.

PART 03 · CORE CONCEPTS

세 개의 자원 법칙과 한 개의 중요한 경계

1. 상태 수와 오차

저자 주장 특정 대수 기억 표적에 대해 최선의 (r)-모드 예측 오차는 위·아래 경계가 모두 다음 꼴이다.

ε(r) = exp(−Θ(√r))   ⇒   r*(τ) = Θ(log²(1/τ))

정확도를 높일수록 필요한 상태는 무한히 커질 수 있으나, 그 증가는 오차 역수의 제곱로그다. 이는 “작은 상태가 쓸모없다”가 아니라 정확도 목표를 명시해야 상태 예산을 논할 수 있다는 뜻이다.

2. 문맥 길이와 예측 격차

FARIMA 계열의 분수 장기기억에서는 유한 문맥 (L)의 예측위험 격차가 정확한 선도항 (V_L−V_∞ = V_∞d²/L + o(L^{-1}))을 갖는다. 단순 계수 꼬리 합이 아니라 분수 적분 뒤의 예측 기하에서 나온다. [2]

3. 수축과 임계성

균일 수축률 ρ<1인 비선형 문맥 순환모델은 첫 번째 Wiener chaos에서 지수 감쇠 외피를 갖는다. 대수 표적의 오차를 0으로 보내려면 ρ가 1에 가까워져야 한다. 그러나 임계점 접근은 필요조건이지 충분조건이 아니다.

4. 적용 경계

확인된 사실 논문 스스로 이 정리가 특정 스칼라 표적, 유한상태·지수 모드 클래스, 균일 수축과 미분 예산에 한정된다고 밝힌다. 선택적 또는 비수축 아키텍처는 범위 밖일 수 있다. 따라서 “Mamba가 log² 상태를 반드시 필요로 한다”거나 “LFM2가 이 하한을 따른다”는 주장은 성립하지 않는다.

PART 04 · INTRODUCTION

효율적 연산자에서 기억 자원 과학으로

2023–2025년의 질문이 “attention을 선형시간 연산자로 대체할 수 있는가”였다면, 2026년의 질문은 “그 압축 상태가 어떤 기억법칙을 얼마의 정확도로 보존하는가”로 이동하고 있다. 전일 글이 기억 회수·상태 추적·하드웨어 공동 설계를 연결했다면, 이번 근거는 그 가운데 회수 정확도와 안정성의 가격표를 제시한다.

새 근거최초 공개 / 개정이번에 추가되는 지식과잉해석 방지
Cost of Long Memory2026-09-24 · v1상태·문맥·임계성의 자원 법칙특정 예측 표적과 모델 클래스
GeoPrior-Mamba2026-10-07 · v1공간방향 Mamba+구조화 과정 선험OCO-2/TCCON 조건의 저자 보고
HAN-Mamba2026-10-07 · v1
ICAART 2026 개정선정 논문
다중 시간척도 Mamba+3-token attention fuserOptiver 단일 benchmark
Scaling Legal AI2025-08-29 · v2 2026-10-07공유 pipeline의 Mamba/Transformer 비교seed 분산·유의성 검정 없음

PART 05 · MOTIVATION AND BACKGROUND

왜 “O(1) 상태”만으로는 충분하지 않은가

순수 고정상태 SSM의 순환 상태 메모리가 시퀀스 길이와 독립이라는 주장은 구현 자원에 관한 말이다. 정보이론적 용량이나 임의 지연의 완전 회수 보장은 아니다. 새 이론은 이 구분을 예측위험으로 정교화한다.

LFM2는 입력 의존 게이트 단거리 합성곱과 일부 GQA를 결합한다. 그러므로 전체 모델을 순수 SSM의 O(1) 상태 또는 완전 선형 모델로 분류할 수 없다. 이번 조사에서 LFM2 이후의 새 학술 기술보고서는 확인되지 않았으며, 제품 발표와 모델카드는 논문 근거와 분리해야 한다.

편집 해석 Mamba와 LFM 계열의 공통 연구동기는 “모든 과거를 저장”하는 것이 아니라 과제 성공에 필요한 증거·상태·예외를 제한된 예산으로 유지하는 것이다. 이 관점은 압축 상태와 선택적 attention, 외부 메모리를 경쟁재가 아니라 보완재로 만든다.

PART 06 · CHALLENGES

정량 법칙이 드러내는 여섯 난제

  1. 정확 회수와 압축: 작은 상태는 평균 예측에는 충분해도 희귀한 키–값 회수에는 실패할 수 있다.
  2. 기억과 상태 추적: 오래된 사실 보존과 최신 상태 덮어쓰기는 반대되는 동작을 요구한다.
  3. 임계성과 수치 안정성: ρ→1은 긴 영향경로를 만들지만 저정밀 누적오차와 reset 정책을 더 중요하게 만든다.
  4. 학습 길이 밖 일반화: 법칙상 가능성과 실제 최적화·데이터 curriculum의 성공은 다르다.
  5. 인과 분해: 데이터, 증류, 도메인 선험, 구조, 커널 최적화의 효과가 뒤섞인다.
  6. 실제 실행 격차: FLOP·선형 복잡도가 CPU/GPU/NPU의 p95 지연·전력·열 throttling을 대신하지 못한다.

특히 GeoPrior-Mamba는 언어모델을 수치 예측 루프 밖에서 선험 표를 구성하는 데 쓰고, HAN-Mamba는 긴 스트림에 Mamba를 쓰되 세 토큰 융합에는 attention을 남긴다. 성공 사례 자체가 순수주의보다 구조화와 배치가 중요함을 시사한다.

PART 07 · RESEARCH QUESTIONS

새 근거가 여는 검증 가능한 질문

연구 질문최소 비교핵심 지표
RQ1. 같은 메모리에서 어떤 정보를 상태로 남길 것인가?사실 회수·상태 추적·희귀 이벤트를 분리근거 회수율, state F1, calibration
RQ2. 최소 attention 비중과 배치는?순수 SSM, local/hybrid, 외부 메모리품질–p95–peak memory Pareto
RQ3. 상태 수 법칙이 selective SSM에도 나타나는가?수축률·선택 게이트·상태 차원 factorial sweep오차 기울기, effective rank
RQ4. 임계점 접근은 저정밀에서 안정한가?FP16/INT8/INT4, 길이·reset 간격 변화drift, overflow, 회복시간
RQ5. 합성 state-tracking이 agent 성공을 예측하는가?합성 parity/recall과 장기 실제 작업 공동 측정상관·실패 예측·오류복구율
RQ6. 선험 지식의 기여는 무엇인가?동일 backbone·데이터에서 prior/adapter 제거표본효율, OOD, 수렴시간
RQ7. 실제 단말에서 성공 작업당 에너지는?동일 양자화·batch·thermal stateJ/success, p95, peak RSS

PART 08 · APPROACHES (METHODS)

정리–아키텍처–응용을 연결하는 방법

A. 목표 기억법칙을 먼저 측정

지연별 예측 기여가 지수 감쇠인지, 멱법칙인지, 사건 기반인지 추정한다. 그 뒤 상태 차원 (r), 문맥 (L), 수축률 ρ를 공동 sweep한다. 이론의 실험은 contractive diagonal SSM, bounded gated recurrence, attention을 정리와 맞춘 합성 표적에서 비교했다. 이는 실제 언어모델 순위를 정하기 위한 실험이 아니다. [2]

B. 방향·척도·선험을 구조화

저자 주장 GeoPrior-Mamba는 다방향 Mamba에 지리·생태·배출·계절 정보를 이용한 결정론적 과정 선험 표를 경량 adapter로 주입한다. 저자들은 OCO-2 2018–2020 held-out에서 RMSE 0.81 ppm, R² 0.93을 보고하며, 동일 프로토콜에서 CAMS 보간 대비 48.2%, Trans-XCO2 대비 3.1% RMSE 감소라고 주장한다. [3]

HAN-Mamba는 단·중·장기 스트림의 attention encoder를 selective Mamba로 바꾸고, 세 스트림 융합에는 3-token attention만 유지한다. Optiver의 시간순 5-fold CV에서 평균 RMSPE 0.1942 대 HAN-T 0.1965, 파라미터 33% 감소, 60→240 bucket 확장 시 0.1927을 보고한다. [4]

C. 공정한 pipeline 비교

법률 벤치마크 v2는 Mamba·SSD-Mamba와 BERT·DeBERTa·Longformer를 공유 windowing·aggregation pipeline으로 비교한다. 저자 보고상 최강 SSM은 최강 Transformer와 약 1.3 percentage point 이내이고 처리량은 DeBERTa의 약 3배, Longformer의 약 4배다. 그러나 random seed 분산과 통계적 유의성 검정이 없어 예비 결과로만 읽어야 한다. [5]

PART 09 · KEY APPLICATIONS

장기기억의 가치는 도메인 구조와 함께 나타난다

응용필요한 기억유망한 구성검증 경계
위성 CO₂ 재구성공간 방향+계절 과정다방향 Mamba+결정론적 prior adapter관측지역·기간 OOD와 물리 일관성
금융 변동성초 단위 변화+주 단위 regime척도별 Mamba+소형 attention fuser시장 이동·거래비용·누출 방지
장문 법률분산된 조문·판례 근거SSM 또는 hybrid+명시적 evidence retrieval관할권·seed·유의성·인용 정확성
온디바이스 보조세션 상태와 사용자 의도압축 상태+최근 문맥+외부 증거양자화 drift·privacy·reset
ETRI Physical AI센서 상태·작업 단계·예외상태 추적+필요 구간 재확인저수준 제어 안전성은 별도 검증

연구 제안 로봇 고수준 계획과 설비 운영지능에서는 SSM 상태를 “사실 저장소”로만 쓰지 말고, 현재 작업 상태의 충분통계로 설계한다. 원본 센서 증거는 외부 로그에 남기고, 불확실성이 임계치를 넘을 때만 attention 또는 검색으로 재확인한다.

PART 10 · OPEN PROBLEMS

정리 뒤에도 남는 문제

  • 과제별 유한상태 한계: 예측위험 법칙을 정확 토큰 회수·복합 상태 추적으로 어떻게 확장할 것인가?
  • 망각 탐지: 상태가 중요한 증거를 잃었다는 사실을 모델 자신이 감지할 수 있는가?
  • 장기 세션 drift/reset: 임계성, 저정밀 오차, 분포 변화가 누적될 때 언제 상태를 재구성할 것인가?
  • 선택성의 이론: 입력 의존 (Ā_t,B̄_t,C_t)가 고정 모드 하한을 어떤 조건에서 우회하거나 재구성하는가?
  • 공정 비교: 동일 데이터·증류·파라미터·양자화·커널·하드웨어 조건의 재현 가능한 평가가 부족하다.
  • 실세계 안전: 환경·금융·법률·로봇 응용의 낮은 평균 오차가 위험한 tail event를 보장하지 않는다.
  • 한국어 전문업무: 긴 법률·특허·운영기록에서 근거 위치와 결론을 동시에 검증하는 공개 benchmark가 필요하다.

가장 큰 미해결 문제는 “상태가 얼마나 큰가”가 아니라 “상태가 틀렸을 때 언제 알아차리고 원증거로 돌아가는가”다.

PART 11 · FUTURE DIRECTIONS

기억 예산을 동적으로 배분하는 계층형 시스템

창의적 연구 제안 다음 세 층을 결합한다. (1) 매 토큰 갱신하는 저비용 압축 상태, (2) 불확실성·충돌·희귀 사건에서만 여는 제한 구간 attention, (3) 출처와 시점을 보존하는 외부 증거 메모리. 모델은 상태 차원을 무조건 키우지 않고, 예측 잔차와 망각 위험에 따라 기억 예산을 늘린다.

단계실험통과 기준
1 · 통제 합성대수/지수/사건 기억, (r,L,ρ), 정밀도 sweep오차 법칙·안정성·reset 재현
2 · 전문업무한국어 법률·특허·설비 로그의 장기 근거 회수근거 회수율·calibration·복구율
3 · 단말 비교동일 학습데이터·양자화·CPU/GPU/NPUJ/success·p95·peak memory
4 · Physical AI상태 오염·통신 단절·센서 누락안전 개입·원증거 복원·rollback
5 · 장기 현장로봇·설비의 주/월 단위 실증drift·가동률·오류복구·감사 가능성

최종 해석 이번 업데이트가 말하는 방향은 “Mamba 대 Transformer”의 단일 승부가 아니다. 기억법칙을 측정하고, 상태·문맥·안정성·외부 증거에 예산을 배분하며, 실제 성공 작업당 비용으로 검증하는 연구다. LFM과 Mamba의 다음 경쟁력은 연산자 이름보다 이 공동 설계 능력에서 갈릴 가능성이 크다.

PRIMARY SOURCES & LIMITATIONS

출처 URL과 검토 경계

실행일 이후 자료는 포함하지 않았다. 날짜는 arXiv 제출 이력과 공식 학회 기록을 구분했다. 프리프린트 결과는 저자 보고이며 독립 재현하지 않았다. 전일 글과 중복되는 배경 논문은 링크로 대체했다.

[1] LFM and Mamba: Memory, State Tracking, and Efficient Edge Intelligence본 블로그 종합 글 · 2026-10-08https://sungsoo.github.io/2026/10/08/lfm-mamba-memory-state-edge-intelligence.html
[2] The Cost of Long Memory: State, Context, and Stability Complexity in Sequence ModelsarXiv v1 · 최초 제출 2026-09-24 · 정식 학회 발표 확인 안 됨https://arxiv.org/abs/2610.08816
[3] GeoPrior-Mamba: Structured Process Priors with Mamba for Fine-Resolution XCO2 ReconstructionarXiv v1 · 최초 제출 2026-10-07 · 정식 학회 발표 확인 안 됨https://arxiv.org/abs/2610.09456
[4] HAN-Mamba: Hierarchical Selective State Space Networks for Multi-Scale Financial Volatility ForecastingarXiv v1 · 최초 제출 2026-10-07 · ICAART 2026 논문의 개정선정 확장본, Springer LNAI 게재 수락은 저자 표기https://arxiv.org/abs/2610.10323
[5] Scaling Legal AI: Benchmarking Mamba and Transformers for Statutory Classification and Case Law RetrievalarXiv v1 2025-08-29 · v2 개정 2026-10-07 · 예비 benchmarkhttps://arxiv.org/abs/2509.00141