AI Research Blog / Local Multimodal AIM5 Max · LM Studio · MLX
Apple Silicon · Multimodal Models · Local Inference · 2026

가장 큰 모델보다,
가장 잘 맞는 모델을 고른다

Local Multimodal AI on Apple M5 Max: Choosing Qwen and Gemma Models in LM Studio

SOURCE · lmstudio-tips.md · OFFICIAL SPECS & DISTRIBUTIONS CHECKED 2026-09-13
M5 MAX · 128GBLM STUDIO · MLXMODEL PORTFOLIOREAL WORKLOAD614 GB/s6-bit FirstQwen · GemmaMeasure40-core GPU · Neural Accelerators8-bit / GGUF as comparison27–35B primary rangeaccuracy · latency · memorySAME INPUT · SAME OUTPUT REQUIREMENT · COMPARE AGAIN

M5 Max 128GB에서 중요한 질문은 “가장 큰 모델이 무엇인가?”가 아니다. 논문 그림·기술문서·화면 캡처를 실제로 더 정확하고 효율적으로 분석하는 모델이 무엇인가가 핵심이다.

첨부자료의 첫 권고는 명확하다. 하나만 고른다면 Qwen3.8-27B MLX 6bit를 먼저 설치한다. 반복 대화의 처리 효율을 비교하려면 Qwen3.6-35B-A3B, 다른 모델 계열로 중요한 분석을 교차검토하려면 Gemma 4 31B를 추가한다. 여기서 멀티모달은 주로 텍스트와 이미지를 입력받아 텍스트로 답하는 기능을 뜻한다.

Evidence boundary

이 추천은 2026년 9월 13일 확인한 공식 사양과 실제 배포본을 바탕으로 한다. 해당 Mac에서 직접 측정한 성능 순위가 아니며, Apple의 기본 M5 대 M4 실험 배수를 M5 Max에 그대로 적용하지 않는다.

M5 Max bandwidth614 GB/s

128GB 구성 공식 사양

M3 Max reference400 GB/s

사양상 약 53.5% 차이

Primary model27B · 6bit

Qwen3.8-27B MLX

Start context16,384

필요하면 32,768+

Part I · Hardware

M5 Max 128GB에서 무엇이 달라지는가

하드웨어 여유는 모델의 선택지를 넓히지만 스펙 숫자가 실제 추론속도에 선형으로 복사되지는 않는다.

기준 구성은 18코어 CPU, 40코어 GPU, 614GB/s 메모리 대역폭이다. M5 Max에는 32코어 GPU도 있지만 128GB 옵션은 40코어 GPU 구성에 해당한다. M3 Max 128GB의 400GB/s와 비교하면 대역폭은 사양상 약 53.5% 높다.

이 53.5%를 모든 모델의 속도 향상률로 해석하면 안 된다. 긴 입력을 읽고 첫 token을 만드는 단계와 이후 token을 생성하는 단계는 계산량과 메모리 대역폭의 영향을 다르게 받는다.

M5 GPU의 Neural Accelerators와 Metal 4를 활용하는 MLX 경로도 중요하다. 다만 Apple이 제시한 개선 실험은 기본 M5와 M4 비교이므로 M5 Max의 실제 배수로 복사하지 않는다. 추천 방향은 27~35B급을 주력으로 두고 6bit·8bit, context와 실제 문서에서 품질·응답시간을 비교하는 것이다.

Part II · Shortlist

다섯 개를 모두 설치하지 말고 하나로 시작한다

역할모델우선 배포본확인 용량
종합 주력Qwen3.8-27BMLX 6bit약 22.8GB
반복 대화·효율 비교Qwen3.6-35B-A3BMLX 6bit약 29.1GB
다른 계열 교차검토Gemma 4 31B ITMLX 6bit약 26.1GB
효율형 GemmaGemma 4 26B-A4B ITMLX 6bit약 21.8GB
가벼운 이미지 질의Qwen3.5-9BMLX 8bit약 10.5GB

표의 크기는 repository에 표시된 저장 용량이다. 실제 실행 메모리는 context cache와 이미지 처리 공간에 따라 달라진다. LM Studio의 memory estimation 역시 context length와 vision model 여부를 반영한다.

Part III · Models

Qwen을 주력으로, Gemma를 독립 검토자로

§1 · Qwen3.8-27B

논문·기술문서 분석의 첫 번째 선택

Qwen3.8-27B는 vision encoder를 포함한 27B dense model이다. 공식 설명은 문서와 과학·기술 도표 이해, 연구작업, coding, multi-step agent task를 주요 대상으로 제시한다. 모델명에 VL이 없어도 image input을 지원한다.

단순 사물인식보다 구조·관계·주장·근거를 함께 분석하는 질문에 주력 후보로 추천한다.

lmstudio-community/Qwen3.8-27B-MLX-6bit lmstudio-community/Qwen3.8-27B-MLX-8bit

확인한 8bit 배포본은 약 29.5GB이다. 6bit부터 시작해 동일 자료로 8bit와 비교한다. LM Studio에서 Reasoning Effort 기본값은 xhigh로 표시되므로 단순 이미지 설명은 Thinking off/low도 시험하고 복합 분석은 medium부터 시작한다.

§2 · Qwen3.6-35B-A3B

후속 질문이 많은 반복 workflow의 효율 후보

약 35B total parameter 중 token 처리 시 약 3B가 활성화되는 MoE 모델이며 vision encoder도 포함한다. A3B가 메모리도 3B 모델 수준이라는 뜻은 아니다. 전체 weights를 보관하며 6bit 배포본도 약 29.1GB이다.

lmstudio-community/Qwen3.6-35B-A3B-MLX-6bit

슬라이드 분석 뒤 설명을 줄이고, 앞 장과 비교하고, 질문을 만드는 식의 반복 workflow에 비교할 가치가 있다. 활성 parameter가 적다는 사실만으로 모든 이미지와 context에서 더 빠르다고 단정하지 않는다.

§3 · Gemma 4

중요한 분석을 다른 모델 계열로 다시 검토한다

Gemma 4 31B는 image input·reasoning·tool calling과 MLX 배포본을 지원하는 31B급 dense model이다. 목적은 Qwen보다 항상 우수한 대체품을 찾는 것이 아니라 한 모델의 해석을 다른 계열로 교차검토하는 것이다.

lmstudio-community/gemma-4-31B-it-MLX-6bit lmstudio-community/gemma-4-26B-A4B-it-MLX-6bit

26B-A4B는 전체 약 25.2B, 활성 약 3.8B인 MoE model이다. dense 계열의 second opinion이면 31B, 반복적인 보조검토의 효율을 원하면 26B-A4B가 적합하다. 두 모델이 같은 답을 했다는 사실만으로 정확성을 증명하지 않으며 원본과 대조한다.

§4 · Qwen3.5-9B

단순 작업을 주력모델에서 분리한다

사진 설명, 화면 캡처 요약, 슬라이드 핵심 메시지 추출 같은 작업에 9B dense model을 사용한다. 128GB라서 작은 모델이 필요한 것이 아니라 작은 작업까지 모두 큰 모델에 맡기지 않기 위해서이다.

lmstudio-community/Qwen3.5-9B-MLX-8bit

작은 parameter 수가 항상 가장 빠른 것을 의미하지 않는다. MoE와 dense 구조가 달라 속도는 실제 작업으로 비교해야 한다.

Part IV · MLX & Quantization

M5 Max에서는 MLX로 시작하고 GGUF는 필요할 때 비교한다

LM Studio는 Apple Silicon에서 MLX와 llama.cpp 기반 GGUF를 모두 지원한다. M5에서는 GPU Neural Accelerators를 활용하는 MLX 경로가 중요하지만 MLX라는 이름만으로 어떤 버전에서도 자동 최적이라는 뜻은 아니다.

LM Studio 0.3.38 release에는 M5 optimized MLX NAX engine으로 자동 upgrade해 macOS 26.2 crash를 고치고 성능을 개선했다는 내용이 있다. 따라서 모델뿐 아니라 앱과 runtime도 함께 관리한다.

지원되는 MLX 배포본으로 시작하고 문제가 있거나 비교가 필요할 때 GGUF를 시험한다. MLX가 모든 모델과 quantization에서 항상 더 빠르다는 의미는 아니다.

6-bitBaseline

주력모델 첫 비교점

8-bitQuality

양자화 손실 감소 방향의 비교

4-bitEfficiency

자원 사용을 더 줄일 때

8bit는 정답 보장 설정이 아니고 6bit는 최적속도 보장 설정도 아니다. 실제 문서에서 품질과 응답시간을 함께 측정한다.

Part V · Starting Settings

최대값 대신 재현 가능한 기준점을 만든다

설정권장 시작점
주력 모델Qwen3.8-27B-MLX-6bit
Context Length16,384로 시작, 입력이 길면 32,768+
이미지 입력한 장부터 시작해 정확도와 지연 확인
Thinking단순 추출·설명은 off도 비교, 복합 분석은 medium부터
Temperature 등모델 기본값 유지
GPU·메모리우선 자동값
동시 실행기준성능은 모델 하나·요청 하나
비교 조건동일 input, output 요구량, 전원설정

모델의 최대 지원 context와 현재 작업에 필요한 context는 다르다. 처음부터 maximum으로 설정할 이유가 없다. LM Studio는 context length를 memory estimation에 반영한다.

M5에 제공되는 최신 안정 macOS와 최신 안정 LM Studio를 사용하고 MLX runtime update를 확인한다. Apple은 M5 Neural Accelerators 활용 MLX 경로에 macOS 26.2 이상이 필요하다고 안내한다. Mac의 runtime 관리 화면은 ⌘ + Shift + R로 열 수 있다.

Activity Monitor에서는 단순 메모리 사용량보다 memory pressure와 swap 변화를 함께 확인한다.

Part VI · Research Workflow

PDF 첨부와 그림 분석을 분리한다

LM Studio의 document attachment는 짧은 문서를 context에 넣거나 긴 문서에서 관련부분을 검색해 제공하는 RAG 방식이다. 따라서 PDF를 붙였다고 모든 표·그림·수식이 이미지로 전달됐다고 가정하지 않는다.

논문 검토는 본문을 문서첨부로 질문하고 그림·표·수식은 필요한 부분을 image로 별도 제공하는 방식이 권장된다.

한국어로 답하라. 첨부 이미지에서 직접 확인되는 내용만 먼저 추출하라. 표의 행·열 제목, 숫자, 단위를 원래 의미대로 유지하라. 읽기 어려운 내용은 추측하지 말고 '판독 불가'라고 표시하라. 그다음 해석을 별도로 작성하라. 관찰된 사실, 추론한 내용, 추가 자료가 필요한 판단을 구분하라.

모델 비교는 문장 유창함보다 숫자 오독, 행·열 누락, 전문용어 변형, 근거 없는 추가, 첫 답변 시간을 본다.

image input 지원이 audio·video direct input까지 뜻하지는 않는다. Gemma 4의 audio 지원처럼 모델 크기별 범위가 다를 수 있고, 모델 기능과 LM Studio가 해당 파일을 직접 받는 기능은 별도로 확인한다.

LM Studio catalog에는 local-download와 cloud-provided model이 함께 표시될 수 있다. 목록에 보인다고 모두 M5 Max에서 local 실행되는 것은 아니다. 배포본과 실행 위치를 확인한다.

Part VII · Decision Framework

주력 하나, 필요할 때 보조 하나

Primary

Qwen3.8-27B MLX 6bit로 실제 논문그림·한국어 보고서·화면 캡처를 평가한다.

Efficiency

반복응답 효율이 중요하면 Qwen3.6-35B-A3B를 동일 자료로 비교한다.

Cross-check

독립검토가 필요하면 Gemma 4 31B, 효율을 더 중시하면 26B-A4B를 추가한다.

M5 Max 128GB에서는 주력 모델의 8bit를 비교할 여유가 있지만 높은 precision 자체를 목표로 삼을 필요는 없다. Qwen3.8-27B를 주력으로 두고 workload가 요구할 때만 효율형 또는 교차검토 모델을 추가하는 것이 최종 권고이다.

M5 Max의 성능은 모델 크기를 무조건 키우는 데 쓰기보다 이미지·문맥·추론·양자화를 실제 작업에 맞춰 균형 있게 조정하는 데 쓰는 편이 낫다.