ai

在 M5 Pro 上用 LM Studio 執行 Qwen3.6 與 Qwen3.8

用 MLX 4-bit 在 Apple Silicon 本機執行兩個 Qwen 模型,並處理 unified memory、context length 與 thinking 設定。

English繁中
在 M5 Pro 上用 LM Studio 執行 Qwen3.6 與 Qwen3.8

在 M5 Pro 上跑本機大型語言模型,安裝本身並不複雜,真正需要留意的是模型格式與 unified memory。這次我在 LM Studio 裡使用兩個 MLX 4-bit 模型:Qwen3.6 35B A3B 與 Qwen3.8 27B。前者的模型檔約 20.43 GB,後者約 16.08 GB;兩個都能處理文字、圖片與 reasoning,但架構和適合的使用方式不完全相同。

先準備 LM Studio 與 MLX runtime

先安裝最新版 LM Studio,再從左下角的 Settings 開啟 Runtime 管理頁面。Apple Silicon 可以使用 llama.cpp 或 Apple 的 MLX;這次下載的是 MLX 版本,因此 Runtime selections 也要選 LM Studio MLX。

我的畫面顯示 LM Studio MLX (Apple M5) 1.11.0。實際使用時不必刻意尋找相同版本號,只要按 Check for updates,確認 MLX extension pack 已安裝且沒有待更新即可。若模型下載完成卻無法載入,這裡是最先該檢查的位置。

LM Studio 已安裝 extension packs,MLX runtime 選用 Apple M5 版本

下載 Qwen3.6 與 Qwen3.8

開啟 Settings → Explore,可以直接搜尋、下載與安裝 model。將格式篩選為 MLX,再搜尋以下模型:

  • qwen/qwen3.6-35b-a3b
  • qwen/qwen3.8-27b

我選擇的都是 4-bit 量化版本。量化會縮小模型檔和記憶體需求,代價是相較高精度版本會損失一些品質。LM Studio 的下載文件建議,有足夠能力的電腦可從 4-bit 或更高精度開始。

在 LM Studio Explore 下載 Qwen3.8 27B MLX 模型

下載後可在 My Models 確認格式、量化精度與檔案大小。這次的 Qwen3.6 35B A3B MLX 4-bit 是 20.43 GB,Qwen3.8 27B MLX 4-bit 是 16.08 GB。

My Models 顯示 Qwen3.6 35B A3B 與 Qwen3.8 27B 的 MLX 4-bit 模型

模型檔大小不等於完整執行需求。載入後還要替 context、KV cache、圖片處理、LM Studio 和 macOS 保留空間。LM Studio 的模型頁分別把 Qwen3.6 35B A3B 與 Qwen3.8 27B 的 minimum system memory 標為 20 GB、16 GB;這是最低值,不是建議配置或效能保證。若 unified memory 只比模型檔大一點,可以先縮短 context、一次只載入一個模型,並關閉占用大量記憶體的 App。

兩個模型怎麼選

Qwen3.6 35B A3B 是 Mixture of Experts(MoE)模型,共有 35B parameters,推論時約啟用 3B。A3B 不代表只要載入 3B 的權重;20.43 GB 的模型檔仍要放進 unified memory。Qwen 的 model card 將 agentic coding 與保留歷史 thinking traces 列為這一版的重點,LM Studio 也提供 Enable Thinking 與 Preserve Thinking 開關。

Qwen3.8 27B 則是 dense model,模型規模是 27B,這次的 4-bit 檔案反而較小。它是較新的版本,強化 coding、研究、agent 工作與圖片理解,並提供 lowmediumxhigh reasoning effort。需要看截圖、分析文件或處理較複雜任務時,可以先試 Qwen3.8;若工作已在 Qwen3.6 上表現穩定,沒有必要只因版本號就立刻切換。

兩者原生 context length 都是 262,144 tokens,不代表筆電每次載入時都要配置這麼多。LM Studio 的資源估算會考慮 context length 與 vision;記憶體受限時,可以先用 16K 或 32K 確認能否載入,再視任務增加。這會限制長 context 與 thinking 的可用空間;Qwen3.6 的 model card 建議至少保留 128K,以維持 thinking 能力。

My Models 點模型右側的齒輪,可以開啟各模型自己的 Model Defaults。System Prompt、Context Length 與生成參數都能在這裡調整,儲存後會在下次載入模型時套用。下圖的 Qwen3.6 使用 16,384 tokens 與 Temperature 0.6;這是本次使用的設定,不是固定要求,其餘選項沒有明確需求時維持預設即可。

Qwen3.6 35B A3B 的 Model Defaults,可調整 context length、temperature 與其他生成設定

載入模型並開始對話

切到 Chat,打開 model loader,選擇其中一個已下載的模型。第一次測試可以這樣做:

  1. Context Length 設為 16K 或 32K。
  2. 先只載入一個模型,確認 macOS 的 Memory Pressure 維持正常。
  3. 用同一段中文提示測試兩個模型,再比較回答品質與等待時間。
  4. 拖入一張截圖,確認 vision 能力與圖片內容辨識正常。
  5. 一般問答可關閉 thinking;程式設計、規劃或多步驟分析再打開。Qwen3.8 可先用 medium,需要更深入推理時才升到 xhigh

除了問答與圖片理解,LM Studio 也能讓模型在專案情境中處理程式工作。下圖是 Qwen3.6 35B A3B 的 coding session,回覆中整理了 JavaScript 重構項目與測試覆蓋案例;畫面右下角同時顯示模型名稱與 Context: 75K

在 LM Studio 使用 Qwen3.6 35B A3B 處理 JavaScript 重構工作

若載入失敗或系統開始大量使用 swap,先卸載另一個模型並降低 context length。仍然不足時,改用更小的模型或更低位元的量化版本,比反覆強制載入更實際。Qwen3.8 雖然模型檔較小,dense 與 MoE 的計算方式不同,也不能只看檔案大小就斷定哪一個一定生成得更快;要用自己的提示、context 與機器實測。

模型下載完成後,LM Studio 可以離線對話。官方的離線操作文件說明,對話輸入會留在這台裝置;搜尋與下載模型、下載 runtime 及檢查更新仍需要網路。

參考資料