在 M5 Pro 上跑本機大型語言模型,安裝本身並不複雜,真正需要留意的是模型格式與 unified memory。這次我在 LM Studio 裡使用兩個 MLX 4-bit 模型:Qwen3.6 35B A3B 與 Qwen3.8 27B。前者的模型檔約 20.43 GB,後者約 16.08 GB;兩個都能處理文字、圖片與 reasoning,但架構和適合的使用方式不完全相同。
先準備 LM Studio 與 MLX runtime
先安裝最新版 LM Studio,再從左下角的 Settings 開啟 Runtime 管理頁面。Apple Silicon 可以使用 llama.cpp 或 Apple 的 MLX;這次下載的是 MLX 版本,因此 Runtime selections 也要選 LM Studio MLX。
我的畫面顯示 LM Studio MLX (Apple M5) 1.11.0。實際使用時不必刻意尋找相同版本號,只要按 Check for updates,確認 MLX extension pack 已安裝且沒有待更新即可。若模型下載完成卻無法載入,這裡是最先該檢查的位置。

下載 Qwen3.6 與 Qwen3.8
開啟 Settings → Explore,可以直接搜尋、下載與安裝 model。將格式篩選為 MLX,再搜尋以下模型:
qwen/qwen3.6-35b-a3bqwen/qwen3.8-27b
我選擇的都是 4-bit 量化版本。量化會縮小模型檔和記憶體需求,代價是相較高精度版本會損失一些品質。LM Studio 的下載文件建議,有足夠能力的電腦可從 4-bit 或更高精度開始。

下載後可在 My Models 確認格式、量化精度與檔案大小。這次的 Qwen3.6 35B A3B MLX 4-bit 是 20.43 GB,Qwen3.8 27B MLX 4-bit 是 16.08 GB。

模型檔大小不等於完整執行需求。載入後還要替 context、KV cache、圖片處理、LM Studio 和 macOS 保留空間。LM Studio 的模型頁分別把 Qwen3.6 35B A3B 與 Qwen3.8 27B 的 minimum system memory 標為 20 GB、16 GB;這是最低值,不是建議配置或效能保證。若 unified memory 只比模型檔大一點,可以先縮短 context、一次只載入一個模型,並關閉占用大量記憶體的 App。
兩個模型怎麼選
Qwen3.6 35B A3B 是 Mixture of Experts(MoE)模型,共有 35B parameters,推論時約啟用 3B。A3B 不代表只要載入 3B 的權重;20.43 GB 的模型檔仍要放進 unified memory。Qwen 的 model card 將 agentic coding 與保留歷史 thinking traces 列為這一版的重點,LM Studio 也提供 Enable Thinking 與 Preserve Thinking 開關。
Qwen3.8 27B 則是 dense model,模型規模是 27B,這次的 4-bit 檔案反而較小。它是較新的版本,強化 coding、研究、agent 工作與圖片理解,並提供 low、medium、xhigh reasoning effort。需要看截圖、分析文件或處理較複雜任務時,可以先試 Qwen3.8;若工作已在 Qwen3.6 上表現穩定,沒有必要只因版本號就立刻切換。
兩者原生 context length 都是 262,144 tokens,不代表筆電每次載入時都要配置這麼多。LM Studio 的資源估算會考慮 context length 與 vision;記憶體受限時,可以先用 16K 或 32K 確認能否載入,再視任務增加。這會限制長 context 與 thinking 的可用空間;Qwen3.6 的 model card 建議至少保留 128K,以維持 thinking 能力。
在 My Models 點模型右側的齒輪,可以開啟各模型自己的 Model Defaults。System Prompt、Context Length 與生成參數都能在這裡調整,儲存後會在下次載入模型時套用。下圖的 Qwen3.6 使用 16,384 tokens 與 Temperature 0.6;這是本次使用的設定,不是固定要求,其餘選項沒有明確需求時維持預設即可。

載入模型並開始對話
切到 Chat,打開 model loader,選擇其中一個已下載的模型。第一次測試可以這樣做:
- Context Length 設為 16K 或 32K。
- 先只載入一個模型,確認 macOS 的 Memory Pressure 維持正常。
- 用同一段中文提示測試兩個模型,再比較回答品質與等待時間。
- 拖入一張截圖,確認 vision 能力與圖片內容辨識正常。
- 一般問答可關閉 thinking;程式設計、規劃或多步驟分析再打開。Qwen3.8 可先用
medium,需要更深入推理時才升到xhigh。
除了問答與圖片理解,LM Studio 也能讓模型在專案情境中處理程式工作。下圖是 Qwen3.6 35B A3B 的 coding session,回覆中整理了 JavaScript 重構項目與測試覆蓋案例;畫面右下角同時顯示模型名稱與 Context: 75K。

若載入失敗或系統開始大量使用 swap,先卸載另一個模型並降低 context length。仍然不足時,改用更小的模型或更低位元的量化版本,比反覆強制載入更實際。Qwen3.8 雖然模型檔較小,dense 與 MoE 的計算方式不同,也不能只看檔案大小就斷定哪一個一定生成得更快;要用自己的提示、context 與機器實測。
模型下載完成後,LM Studio 可以離線對話。官方的離線操作文件說明,對話輸入會留在這台裝置;搜尋與下載模型、下載 runtime 及檢查更新仍需要網路。