작은 상태는
무엇을 기억할 수 있는가LFM과 Mamba의 다음 질문
Memory, State Tracking, and Efficient Edge Intelligence
LFM2는 모델군, Mamba는 아키텍처다. 공통 목표는 제한된 자원에서 기억과 판단의 유용성을 유지하는 것이다. 작은 화면에서는 그림을 좌우로 이동할 수 있다.
적은 메모리로 오래 실행하는 능력은, 필요한 사실을 오래 정확하게 활용하는 능력과 다르다.
이 글은 LFM과 Mamba를 구분하고, 모델 품질·기억 회수·상태 추적·실제 실행비용을 하나의 연구 지도로 연결한다. 핵심 질문은 제한된 자원으로 무엇을 보존하고, 무엇을 다시 확인하며, 언제 복구할 것인가다.
기존 글과의 관계. 2026-06-15 Mamba 개요를 바탕으로, 이 글은 LFM과의 개념 구분·2025–2026 논문 근거·기억 회수와 상태 추적·하반기 배포 연구를 확장한다.
2026년 하반기 보강. 연관 회수의 scaling 분석 [11], CGLA 커널 병목 [12], 실내 위치추정 사례 [13]를 포함했다. LFM2.5의 양자화·추측 디코딩 [15–17]은 기업 발표로 분리했다. 9월 24일의 VL-DSpark는 비전언어 모델용 실험적 초안 모델을 추가한 사례이며, 학술 검증을 대신하지 않는다. [17] [18]
모델군과 아키텍처를 구분하는 출발점
확인된 구조. LFM은 Liquid AI의 Liquid Foundation Models라는 모델군이다. 공개된 LFM2는 입력 의존 게이트 단거리 합성곱과 일부 grouped-query attention(GQA)을 결합한다. Mamba는 선택적 상태공간 모델(SSM)을 사용하는 시퀀스 아키텍처다. 따라서 LFM과 Mamba는 같은 분류 수준의 개념이 아니다. [1] [2]
| 개념 | 설명 단위 | 핵심 설계 질문 |
|---|---|---|
| LFM2 | 학습된 모델과 훈련·배포 체계 | 실제 단말 제약에서 어떤 연산자 조합이 유리한가 |
| Mamba 계열 | 선택적 상태 갱신 아키텍처 | 압축된 상태로 어떤 정보를 보존하고 계산하는가 |
| LTC / Liquid Neural Networks | 연속시간 동역학에 관한 별도 연구 계보 | 시간에 따른 적응적 동역학을 어떻게 표현하는가 |
해석의 경계. LFM=LTC=LNN=Mamba라는 등식은 성립하지 않는다. 특히 LFM2의 공개 구조를 모든 LFM 세대에 소급하거나, liquid라는 이름만으로 추론 중 가중치를 학습한다고 설명해서는 안 된다. 비교의 단위는 이름보다 구체적인 체크포인트와 연산자 구성이다.
긴 이력과 짧은 응답시간을 함께 만족시키기
현장 보조 에이전트는 앞선 지시를 기억하면서 현재 상황에 반응해야 한다. 모든 이력을 직접 참조하면 비용이 커지고, 과도하게 압축하면 필요한 사실이 사라진다. 연구의 공통 문제는 이 두 비용을 함께 다루는 것이다.
subject to L95 ≤ Lmax, Mpeak ≤ Mmax, Etask ≤ Emax
편집 정식화. A는 구조, θ는 학습된 파라미터, L95는 p95 지연, Mpeak는 피크 메모리, Etask는 작업당 에너지다. 특정 논문의 목적함수를 그대로 옮긴 것이 아니라, 배포와 기억 연구를 결합한 설계 문제다.
| 구조 / 구간 | 길이 T에 따른 연산 | 추론 시 이력 저장 |
|---|---|---|
| 표준 full attention · prefill | 어텐션 항 O(T²) | KV cache O(T) |
| 표준 full attention · 한 토큰 decode | 어텐션 항 O(T) | KV cache O(T) |
| 고정 크기 순환 상태의 순수 SSM | 전체 O(T), 한 단계 O(1) | 순환 상태 O(1) |
| SSM + 고정 윈도 어텐션 | 윈도 고정 시 전체 선형 가능 | 상태와 고정 윈도 캐시 |
| 합성곱 / SSM + full attention | 전체 어텐션 부분의 길이 의존 유지 | 해당 층의 KV cache 증가 |
위 표는 모델 폭·깊이·상태 크기를 고정한 시퀀스 길이 기준이며, 전체 훈련 메모리의 상수성을 뜻하지 않는다. GQA는 KV cache의 계수를 줄이지만 길이 의존을 없애지 않는다. LFM2나 full-attention 혼합 모델 전체를 상수 메모리라고 부를 수 없다. [1] [2] [3]
기억, 선택, 회수, 상태 추적은 서로 다르다
yt = Ct ht
h는 과거를 압축한 내부 상태다. Ā는 이전 상태를 유지·변환하고, B̄는 새 입력을 반영하며, C는 출력에 필요한 내용을 읽는다. 선택성은 이 연산의 일부가 입력에 의존한다는 뜻이다. 위 식은 기본 개념식이며 Mamba-3의 추가 항까지 모두 표현한 식은 아니다. [2]
직관. “처음 등장한 비밀번호는?”은 기억 회수다. “꺼진 스위치를 세 번 반전시킨 뒤 현재 켜져 있는가?”은 사건의 의미와 순서를 반영하는 상태 추적이다. 내부 상태가 존재한다는 사실만으로 두 능력이 보장되지는 않는다. [6] [7]
음의 고유값 연구는 유한정밀도 선형 RNN의 전이 제약을 분석하고, parity와 같은 과제에서 표현력의 차이를 보여준다. 후속 연구는 대각 전이 조건에서 입력 의존성과 음의 고유값을 서로 다른 층에 나눠 넣는 것만으로 충분하지 않음을 분석한다. 이를 모든 SSM의 보편적 불가능성으로 확대하면 안 된다. [6] [7]
길이에 독립적인 상태 크기와 무제한 정보의 완전 보존은 다르다. 같은 저장 공간에 사실이 많아지면 구별해야 할 패턴도 늘어난다. 2026년 recall scaling 연구는 이 문제를 학습된 선형 해싱과 연관 회수 용량의 관점에서 구체화한다. [11]
효율적인 연산자에서 검증 가능한 기억으로
문헌 종합. 최근 흐름은 단순히 어텐션을 더 싼 연산자로 대체하는 데서 끝나지 않는다. 어떤 사실이 살아남는지, 사건의 순서를 계산하는지, 실제 장치에서 병목이 어디에 생기는지까지 연구 범위가 확장된다.
| 연구 축 | 대표 자료 | 이 글에서의 질문 |
|---|---|---|
| 단말 중심 공동 설계 | LFM2 · LFM2.5 | 구조·데이터·런타임의 조합이 무엇인가 |
| 기억 회수 | Samba · hybrid 분석 · MemMamba | 압축 후에도 필요한 사실을 찾는가 |
| 상태 전이 표현력 | Negative Eigenvalues · SLiCEs | 보존을 넘어 누적 변화를 계산하는가 |
| 추론 실행 | Mamba-3 · CGLA 커널 분석 | 수학적 효율이 실제 지연으로 이어지는가 |
각 축은 경쟁하는 단일 순위가 아니다. 응용이 요구하는 기억의 종류와 하드웨어에 따라 최적점이 달라진다. 어떤 모델이 더 빠른가보다 어떤 조건에서 어떤 능력을 유지하는가가 더 유용한 비교 질문이다. [4] [8] [12]
작은 장치에서도 오래 유용해야 하는 이유
장기 실행 에이전트의 가치는 대화 한 번의 정확도보다 누적된 작업을 얼마나 일관되게 수행하는지에 달려 있다. 이전에 취소된 지시가 다시 실행되거나, 잘못된 센서 관측이 계속 유지되면 빠른 모델도 유용하지 않다. 이는 실제 응용을 위한 문제 설정이다.
2026년 LFM2.5 공식 발표는 온디바이스 에이전트와 멀티모달 실행을 강조한다. 8월의 QAD 발표는 양자화된 학생을 고정밀 교사로 학습하는 배포 경로를, DSpark 발표는 초안 토큰을 검증해 생성 속도를 높이는 경로를 제시한다. [10] [14] [15] [16]
해석. 구조만 바꾸는 전략에서 학습·정밀도·추측 디코딩까지 함께 조정하는 전략으로 범위가 넓어진다. 다만 이 자료들은 기업의 공식 기술 발표이며 독립 재현 실험과 동일하지 않다. 장치의 열 상태, 배치, 입력 길이, 초안 수용률을 맞춰 다시 측정해야 한다.
좋은 토큰 생성기와 좋은 업무 수행기는 서로 다른 평가를 요구한다. 답변이 빨라도 재시도가 많으면 성공 작업당 비용은 커진다. 모델 평가와 시스템 평가를 연결할 필요가 있다.
압축의 손실과 실행의 병목을 함께 측정하기
| 난제 | 왜 어려운가 | 확인할 실험 |
|---|---|---|
| 장거리 정확 회수 | 사실의 압축 충돌·간섭·감쇠 | 사실 수, 거리, 방해 정보의 독립 조절 |
| 상태 추적 | 내용 보존과 사건 계산의 차이 | 취소·반전·순서 변경·중첩 규칙 |
| 길이 일반화 | 학습 길이 밖의 상태 사용 변화 | 학습 길이 대비 2배·4배 등 별도 구간 |
| 실제 실행 | 메모리 이동과 커널 경계 비용 | prefill·decode·센서 전처리 분리 계측 |
| 원인 분리 | 데이터·증류·구조의 동시 변경 | 동일 학습 예산과 절제 실험 |
| 저정밀 장기 실행 | 상태 오차 누적 가능성 | 정밀도별 장시간 drift·reset 비교 |
MemMamba는 상태 요약 및 교차 계층·토큰 어텐션으로 장거리 망각 완화를 시도한다. 이 접근의 의미는 “상태가 있으니 기억한다”는 설명을 넘어, 정보 손실을 측정하고 보완하려는 데 있다. [5]
2026년 CGLA 연구는 IMAX에 투영·SSD·상태 갱신 커널을 배치하고, Mamba-130M 통합 실험에서 decode의 투영 GEMV 병목을 보고한다. 특정 장치의 결과지만, SSM 연산만 빠르게 해도 전체 모델은 빨라지지 않을 수 있음을 보여주는 사례다. [12]
제안. 저정밀 상태 오차와 장기 drift는 별도의 검증 항목으로 둔다. weight 양자화 점수만으로 장시간 순환 상태의 안정성을 입증할 수는 없다.
관측 가능한 결과로 바꾸는 여섯 가지 질문
다음 질문들은 문헌의 결과를 연결한 연구 제안이다. 각 질문에 반증 가능한 실험과 실패 기준을 붙이면 기술 선택의 근거가 된다.
| 연구 질문 | 가설 · 제안 | 반증 가능한 비교 |
|---|---|---|
| RQ1. 같은 메모리에 무엇을 저장할까? | 희귀하지만 임무 관련성이 높은 사건을 우선 보존 | 최신성·빈도·임무 관련성 기반 저장 비교 |
| RQ2. 어텐션의 최소 비중은? | 회수 난도가 높은 구간에 선택적으로 투입 | 같은 지연 예산의 층 비율·배치 비교 |
| RQ3. 표현력과 병렬화의 균형은? | 구조화 전이로 상태 계산 능력 보완 | 대각·블록 대각·복소수 전이 비교 |
| RQ4. 양자화에 강한 기억은? | 상태와 가중치의 정밀도를 다르게 배분 | 동일 메모리에서 혼합 정밀도 비교 |
| RQ5. 합성 성능이 agent 성공을 예측할까? | 회수와 상태 추적이 서로 다른 실패를 예측 | parity·MQAR와 다단계 작업 실패의 관계 |
| RQ6. 실제 에너지 이득은? | 빠른 모델도 재시도 때문에 불리할 수 있음 | 성공 작업당 Joule와 사람 개입 포함 비교 |
Hybrid 연구의 순차·병렬 연결 비교와 SLiCEs의 구조화 전이 분석은 RQ2·RQ3의 출발점이다. 이 결과를 실제 업무의 결론으로 바꾸려면 동일 예산의 실증이 필요하다. [4] [8]
서로 다른 병목에 서로 다른 방법을 적용하기
8.1 실제 장치에서 구조를 선택하는 LFM2
LFM2는 hardware-in-the-loop 탐색, Top-K 지식 증류, curriculum 및 사후학습을 함께 사용한다. SFT, 길이 정규화 선호 최적화, 모델 병합이 학습 체계에 포함된다. 따라서 구조의 기여와 데이터·학습의 기여를 분리해야 한다. [1]
8.2 상태 갱신과 하드웨어 활용을 바꾸는 Mamba-3
Exponential-trapezoidal 이산화는 상태 갱신식을 확장하고, 복소수 상태는 회전 성분을 통해 표현력을 보완한다. MIMO는 상태 갱신을 더 풍부한 행렬 연산으로 구성한다. 연산 수 감소와 실제 지연 감소는 같은 목표가 아니다. 메모리 병목 상황에서는 연산을 늘려도 실행시간이 유사할 수 있다. [2]
8.3 기억 회수의 구조와 데이터를 함께 개선하기
Samba는 SSM과 sliding-window attention을 층 단위로 결합한다. 후속 hybrid 분석에서는 짧은 문맥에서 순차 구조, 긴 문맥에서 병렬 구조가 더 유리한 실험 결과를 보고한다. Paraphrase 기반 추가 학습도 회수 개선에 기여한다. 이 관계는 모든 모델에 대한 보편 법칙이 아니라 해당 평가의 관찰이다. [3] [4]
MemMamba는 요약과 교차 연결을 활용한다. Recall scaling 연구는 연관 회수를 해싱 관점에서 분석해 어휘 크기·사실 수·상태와 임베딩 차원을 연결한다. 자연어 장문 추론의 모든 능력을 이 회수 과제로 환원할 수는 없지만, 메모리 예산의 실험 축을 명확히 만든다. [5] [11]
8.4 상태 전이의 표현력을 확대하기
음의 고유값 연구와 후속 parity 분석은 전이 제약의 중요성을 보여준다. SLiCEs는 블록 대각·희소·Walsh–Hadamard 구조를 통해 계산 부담을 줄이면서, 논문에서 정의한 조밀 전이의 표현력에 도달하는 방법을 제시한다. [6] [7] [8]
8.5 보고된 결과를 읽는 기준
| 근거 | 저자 보고 / 확인 조건 | 해석의 한계 |
|---|---|---|
| LFM2 CPU 평가 [1] | Galaxy S25 Snapdragon 8 Elite 및 Ryzen AI 9 HX 370, llama.cpp Q4_0, batch 1 | 보고서의 최대 약 2배 이득을 모든 기기·길이에 적용하지 않음 |
| Mamba-3 [2] | 1.5B 규모에서 MIMO의 평균 downstream 정확도가 Gated DeltaNet보다 1.8%p 높음 | 연구 내 학습·평가 조건의 비교이며 LFM2와의 직접 대조 아님 |
| Samba [3] | 3.8B, 3.2T 학습 토큰; 4K 미세조정 후 256K passkey 회수 결과 | 특정 passkey 성공이 무제한 사실 회수를 뜻하지 않음 |
| LFM2.5 DSpark [16] | H100 80GB BF16/SGLang, M4 Max FP16/llama.cpp Metal; batch 1, temperature 0, block 9 | 추측 디코딩의 속도 이득은 초안 수용률·과제·런타임에 의존 |
위 표는 독립 재현 결과가 아니다. 동일한 학습 데이터·문맥 길이·배치·정밀도 조건의 통합 순위표도 아니다. 비교 조건이 다른 수치를 하나의 막대그래프로 합치지 않았다.
온디바이스 보조에서 현장 협업지능까지
공개된 모델 범위. LFM2 보고서는 텍스트 외에도 비전·음성·ColBERT 검색 변형을 포함한다. LFM2.5는 제품 발표 수준에서 로컬 도구 사용과 멀티모달 응용을 확장한다. 검색 인코더와 생성 모델의 성능 지표는 구분해야 한다. [1] [10] [14]
최근 연구 사례. 2026-10-05 제출된 LocAttMamba는 AP별 신호 특징을 Mamba로 인코딩하고 어텐션으로 융합하는 실내 위치추정 구조를 제안한다. 5G·UWB 실측 데이터 평가와 위치 불확실성 보정을 보고한다. 여기서는 확인 가능한 초록 수준의 방법 소개로 제한하며 세부 속도 수치를 재현된 결과로 인용하지 않는다. [13]
| ETRI 응용 제안 | 모델이 담당할 기능 | 현장 검증 |
|---|---|---|
| 로봇 고수준 작업 관리 | 지시·진행·취소 상태의 유지 | 잘못된 재실행과 누락, 상태 복구 |
| 제조 설비 운영 보조 | 센서 이력 요약과 정비 문서 검색 | 이상 탐지·근거 회수·오경보 비용 |
| 현장 오프라인 보조 | 통신 단절 시 로컬 질의와 도구 선택 | 연결 복구 후 기록 일관성 |
| 다중 로봇 협업 | 임무 관련 요약 상태의 교환 | 통신량 대비 완료율과 충돌·교착 복구 |
위 네 응용은 연구 제안이다. 언어·시퀀스 모델의 상태 추적 능력은 저수준 제어의 안정성이나 물리적 안전성 보증과 다르다. 모델 출력에서 실제 행동까지의 검증 경로를 별도로 설계해야 한다.
기억이 있다는 주장과 믿을 수 있는 기억의 간극
유한 상태의 과제별 한계
2025년 계산복잡도 논문은 다항 정밀도와 상수 깊이 등의 가정에서 SSM·Mamba를 TC⁰ 회로로 분석한다. 이는 내부 상태만으로 더 강한 계산 능력을 자동 확보한다는 해석을 경계하게 한다. 해당 가정 밖의 모델, 깊이 변화, 복소수 전이, 외부 메모리까지 같은 결론을 적용해서는 안 된다. [9]
망각을 감지하고 고칠 수 있는가
미해결 질문. 틀린 답을 출력하는 것과 기억이 불완전함을 인지하는 것은 다르다. 저장된 증거와 내부 상태가 충돌할 때, 무엇을 신뢰할지 결정할 기준이 필요하다. 압축 상태에는 원문 출처가 그대로 남지 않을 수 있으므로 provenance를 별도로 유지하는 설계도 검토할 만하다.
장기 세션과 한국어 전문업무
일부 상태만 수정할지, 기록을 재생해 복원할지, 전체 reset을 수행할지에 대한 비용·정확도 비교가 필요하다. 한국어 약어, 기관별 문서, 날짜가 바뀐 규정, 센서 잡음과 다자 지시를 포함하는 평가도 요구된다. 이는 선정 문헌에서 완료된 결과가 아니라 실제 적용을 위한 연구 공백이다.
공정한 비교에는 동일한 실패 조건이 포함되어야 한다. 정상 입력의 평균 정확도만 같게 맞추면 긴 꼬리 오류와 복구 비용이 숨겨질 수 있다.
기억 예산을 임무 성과와 연결하는 연구
시스템 제안. 압축 상태는 빠른 상황 갱신을, 제한된 어텐션은 정밀한 구간 참조를, 외부 메모리는 출처와 장기 기록을 맡도록 설계할 수 있다. 모든 정보를 항상 같은 방식으로 처리하는 대신, 불확실성이나 사건 중요도에 따라 기억 예산을 조정하는 방식이다.
기억 관리기가 빠른 내부 상태, 직접 참조, 장기 증거 저장의 역할을 나누고 판단 단계에서 일관성을 확인한다. 작은 화면에서는 그림을 좌우로 이동할 수 있다.
적응형 예산은 상태 크기의 증가만 뜻하지 않는다. 어떤 순간에 원문 검색을 호출할지, 어느 기록을 남길지, 언제 상태를 재구성할지도 포함한다. 이 제안은 새로운 아키텍처 이름을 만드는 것보다 기억의 비용과 실패를 관측 가능하게 만드는 것에 초점을 둔다.
| 연구 단계 · 제안 | 산출물 | 검증 관문 |
|---|---|---|
| 1. 동일 조건 비교 | SSM·합성곱·어텐션 혼합 기준모델과 공개 평가셋 | 동일 데이터·학습 예산·양자화·하드웨어 |
| 2. 복구 가능한 상태 | 오염 감지·증거 기반 재구성·선택적 reset 모듈 | 오류 주입, 작업 취소, 통신 단절 시험 |
| 3. 장기 현장 실증 | 로봇·설비·현장 보조의 운용 기록 | 성공 작업당 에너지·지연·오류복구·사람 개입 |
평가 제안. 에너지는 전체 시도에서 소비한 Joule을 성공 작업 수로 나누고 재시도도 포함한다. p95 지연은 입력부터 검증된 응답 또는 행동 승인까지의 범위를 명시한다. 근거 회수율과 오류복구율은 별도 정답 집합과 실패 주입 조건에서 측정한다. 성공 건수가 0이면 비용을 유한한 좋은 값으로 보고하지 않는다.
연구 목표는 특정 모델군의 채택 자체가 아니다. ETRI의 온디바이스 협업지능에서 중요한 것은 제한된 자원으로 필요한 상태와 증거를 유지하고, 틀렸을 때 복구할 수 있음을 입증하는 일이다.
출처와 검증 범위
서지 날짜는 원문의 제출·개정 이력 기준이다. 개정일을 확인하지 못한 항목은 추정하지 않았다. 2024년 최초 공개인 [3]과 [6]은 2025년 학회 연구로 포함했다. 링크 확인일: 2026-10-08.