M5 Max 128GB에서 중요한 질문은 “가장 큰 모델이 무엇인가?”가 아니다. 논문 그림·기술문서·화면 캡처를 실제로 더 정확하고 효율적으로 분석하는 모델이 무엇인가가 핵심이다.
첨부자료의 첫 권고는 명확하다. 하나만 고른다면 Qwen3.8-27B MLX 6bit를 먼저 설치한다. 반복 대화의 처리 효율을 비교하려면 Qwen3.6-35B-A3B, 다른 모델 계열로 중요한 분석을 교차검토하려면 Gemma 4 31B를 추가한다. 여기서 멀티모달은 주로 텍스트와 이미지를 입력받아 텍스트로 답하는 기능을 뜻한다.
이 추천은 2026년 9월 13일 확인한 공식 사양과 실제 배포본을 바탕으로 한다. 해당 Mac에서 직접 측정한 성능 순위가 아니며, Apple의 기본 M5 대 M4 실험 배수를 M5 Max에 그대로 적용하지 않는다.
128GB 구성 공식 사양
사양상 약 53.5% 차이
Qwen3.8-27B MLX
필요하면 32,768+
M5 Max 128GB에서 무엇이 달라지는가
하드웨어 여유는 모델의 선택지를 넓히지만 스펙 숫자가 실제 추론속도에 선형으로 복사되지는 않는다.
기준 구성은 18코어 CPU, 40코어 GPU, 614GB/s 메모리 대역폭이다. M5 Max에는 32코어 GPU도 있지만 128GB 옵션은 40코어 GPU 구성에 해당한다. M3 Max 128GB의 400GB/s와 비교하면 대역폭은 사양상 약 53.5% 높다.
이 53.5%를 모든 모델의 속도 향상률로 해석하면 안 된다. 긴 입력을 읽고 첫 token을 만드는 단계와 이후 token을 생성하는 단계는 계산량과 메모리 대역폭의 영향을 다르게 받는다.
M5 GPU의 Neural Accelerators와 Metal 4를 활용하는 MLX 경로도 중요하다. 다만 Apple이 제시한 개선 실험은 기본 M5와 M4 비교이므로 M5 Max의 실제 배수로 복사하지 않는다. 추천 방향은 27~35B급을 주력으로 두고 6bit·8bit, context와 실제 문서에서 품질·응답시간을 비교하는 것이다.
다섯 개를 모두 설치하지 말고 하나로 시작한다
| 역할 | 모델 | 우선 배포본 | 확인 용량 |
|---|---|---|---|
| 종합 주력 | Qwen3.8-27B | MLX 6bit | 약 22.8GB |
| 반복 대화·효율 비교 | Qwen3.6-35B-A3B | MLX 6bit | 약 29.1GB |
| 다른 계열 교차검토 | Gemma 4 31B IT | MLX 6bit | 약 26.1GB |
| 효율형 Gemma | Gemma 4 26B-A4B IT | MLX 6bit | 약 21.8GB |
| 가벼운 이미지 질의 | Qwen3.5-9B | MLX 8bit | 약 10.5GB |
표의 크기는 repository에 표시된 저장 용량이다. 실제 실행 메모리는 context cache와 이미지 처리 공간에 따라 달라진다. LM Studio의 memory estimation 역시 context length와 vision model 여부를 반영한다.
Qwen을 주력으로, Gemma를 독립 검토자로
논문·기술문서 분석의 첫 번째 선택
Qwen3.8-27B는 vision encoder를 포함한 27B dense model이다. 공식 설명은 문서와 과학·기술 도표 이해, 연구작업, coding, multi-step agent task를 주요 대상으로 제시한다. 모델명에 VL이 없어도 image input을 지원한다.
단순 사물인식보다 구조·관계·주장·근거를 함께 분석하는 질문에 주력 후보로 추천한다.
확인한 8bit 배포본은 약 29.5GB이다. 6bit부터 시작해 동일 자료로 8bit와 비교한다. LM Studio에서 Reasoning Effort 기본값은 xhigh로 표시되므로 단순 이미지 설명은 Thinking off/low도 시험하고 복합 분석은 medium부터 시작한다.
후속 질문이 많은 반복 workflow의 효율 후보
약 35B total parameter 중 token 처리 시 약 3B가 활성화되는 MoE 모델이며 vision encoder도 포함한다. A3B가 메모리도 3B 모델 수준이라는 뜻은 아니다. 전체 weights를 보관하며 6bit 배포본도 약 29.1GB이다.
슬라이드 분석 뒤 설명을 줄이고, 앞 장과 비교하고, 질문을 만드는 식의 반복 workflow에 비교할 가치가 있다. 활성 parameter가 적다는 사실만으로 모든 이미지와 context에서 더 빠르다고 단정하지 않는다.
중요한 분석을 다른 모델 계열로 다시 검토한다
Gemma 4 31B는 image input·reasoning·tool calling과 MLX 배포본을 지원하는 31B급 dense model이다. 목적은 Qwen보다 항상 우수한 대체품을 찾는 것이 아니라 한 모델의 해석을 다른 계열로 교차검토하는 것이다.
26B-A4B는 전체 약 25.2B, 활성 약 3.8B인 MoE model이다. dense 계열의 second opinion이면 31B, 반복적인 보조검토의 효율을 원하면 26B-A4B가 적합하다. 두 모델이 같은 답을 했다는 사실만으로 정확성을 증명하지 않으며 원본과 대조한다.
단순 작업을 주력모델에서 분리한다
사진 설명, 화면 캡처 요약, 슬라이드 핵심 메시지 추출 같은 작업에 9B dense model을 사용한다. 128GB라서 작은 모델이 필요한 것이 아니라 작은 작업까지 모두 큰 모델에 맡기지 않기 위해서이다.
작은 parameter 수가 항상 가장 빠른 것을 의미하지 않는다. MoE와 dense 구조가 달라 속도는 실제 작업으로 비교해야 한다.
M5 Max에서는 MLX로 시작하고 GGUF는 필요할 때 비교한다
LM Studio는 Apple Silicon에서 MLX와 llama.cpp 기반 GGUF를 모두 지원한다. M5에서는 GPU Neural Accelerators를 활용하는 MLX 경로가 중요하지만 MLX라는 이름만으로 어떤 버전에서도 자동 최적이라는 뜻은 아니다.
LM Studio 0.3.38 release에는 M5 optimized MLX NAX engine으로 자동 upgrade해 macOS 26.2 crash를 고치고 성능을 개선했다는 내용이 있다. 따라서 모델뿐 아니라 앱과 runtime도 함께 관리한다.
지원되는 MLX 배포본으로 시작하고 문제가 있거나 비교가 필요할 때 GGUF를 시험한다. MLX가 모든 모델과 quantization에서 항상 더 빠르다는 의미는 아니다.
주력모델 첫 비교점
양자화 손실 감소 방향의 비교
자원 사용을 더 줄일 때
8bit는 정답 보장 설정이 아니고 6bit는 최적속도 보장 설정도 아니다. 실제 문서에서 품질과 응답시간을 함께 측정한다.
최대값 대신 재현 가능한 기준점을 만든다
| 설정 | 권장 시작점 |
|---|---|
| 주력 모델 | Qwen3.8-27B-MLX-6bit |
| Context Length | 16,384로 시작, 입력이 길면 32,768+ |
| 이미지 입력 | 한 장부터 시작해 정확도와 지연 확인 |
| Thinking | 단순 추출·설명은 off도 비교, 복합 분석은 medium부터 |
| Temperature 등 | 모델 기본값 유지 |
| GPU·메모리 | 우선 자동값 |
| 동시 실행 | 기준성능은 모델 하나·요청 하나 |
| 비교 조건 | 동일 input, output 요구량, 전원설정 |
모델의 최대 지원 context와 현재 작업에 필요한 context는 다르다. 처음부터 maximum으로 설정할 이유가 없다. LM Studio는 context length를 memory estimation에 반영한다.
M5에 제공되는 최신 안정 macOS와 최신 안정 LM Studio를 사용하고 MLX runtime update를 확인한다. Apple은 M5 Neural Accelerators 활용 MLX 경로에 macOS 26.2 이상이 필요하다고 안내한다. Mac의 runtime 관리 화면은 ⌘ + Shift + R로 열 수 있다.
Activity Monitor에서는 단순 메모리 사용량보다 memory pressure와 swap 변화를 함께 확인한다.
PDF 첨부와 그림 분석을 분리한다
LM Studio의 document attachment는 짧은 문서를 context에 넣거나 긴 문서에서 관련부분을 검색해 제공하는 RAG 방식이다. 따라서 PDF를 붙였다고 모든 표·그림·수식이 이미지로 전달됐다고 가정하지 않는다.
논문 검토는 본문을 문서첨부로 질문하고 그림·표·수식은 필요한 부분을 image로 별도 제공하는 방식이 권장된다.
모델 비교는 문장 유창함보다 숫자 오독, 행·열 누락, 전문용어 변형, 근거 없는 추가, 첫 답변 시간을 본다.
image input 지원이 audio·video direct input까지 뜻하지는 않는다. Gemma 4의 audio 지원처럼 모델 크기별 범위가 다를 수 있고, 모델 기능과 LM Studio가 해당 파일을 직접 받는 기능은 별도로 확인한다.
LM Studio catalog에는 local-download와 cloud-provided model이 함께 표시될 수 있다. 목록에 보인다고 모두 M5 Max에서 local 실행되는 것은 아니다. 배포본과 실행 위치를 확인한다.
주력 하나, 필요할 때 보조 하나
Qwen3.8-27B MLX 6bit로 실제 논문그림·한국어 보고서·화면 캡처를 평가한다.
반복응답 효율이 중요하면 Qwen3.6-35B-A3B를 동일 자료로 비교한다.
독립검토가 필요하면 Gemma 4 31B, 효율을 더 중시하면 26B-A4B를 추가한다.
M5 Max 128GB에서는 주력 모델의 8bit를 비교할 여유가 있지만 높은 precision 자체를 목표로 삼을 필요는 없다. Qwen3.8-27B를 주력으로 두고 workload가 요구할 때만 효율형 또는 교차검토 모델을 추가하는 것이 최종 권고이다.
M5 Max의 성능은 모델 크기를 무조건 키우는 데 쓰기보다 이미지·문맥·추론·양자화를 실제 작업에 맞춰 균형 있게 조정하는 데 쓰는 편이 낫다.