
LM Studio_模型選擇&本地伺服器_Part_2
模型選擇
安裝好之後,要如何去選擇更多的模型呢?
點此:

再來可以選「下載次數最多」的來使用

如果顯示卡記憶體不足,也可以選小型模型使用例如:「gemma-3-4b」,點右下角下載就會自動下載了

大家會問說,那我應該選擇哪個模型好呢?這邊給一個對照表給大家參考:
VRAM 區間 | 建議模型上限(參考) | 範例模型(指令/聊天向) | 合適任務 | 範例模型(程式/工具向) | 建議量化 |
≤ 4 GB | 1–3.8B | Llama 3.2 1B、Qwen2.5 1.5B、Phi-3 mini 3.8B(勉強) | 超輕量聊天、摘要、簡單分類,多語基礎 | Qwen2.5-Coder 1.5B | GGUF 4-bit(q4_k_m/q5_k_m),KV Cache 壓縮 |
6 GB | 7–8B(2–4K ctx 較穩) | Mistral 7B Instruct、Llama 3.1 8B(ctx 別太長) | 一般聊天、基礎推理、英文/中英雙語 | DeepSeek-Coder 6.7B、Qwen2.5-Coder 7B | 4-bit |
8 GB | 穩定跑 7–8B(4–8K ctx) | Qwen2.5 7B Instruct、Llama 3.1 8B、Mistral 7B | 多語對話、摘要、RAG 前端模型 | Qwen2.5-Coder 7B、DeepSeek-Coder 6.7B | 4-bit(或8-bit跑 3–7B) |
12 GB | 10–14B(4-bit),或 7–8B(8-bit 更穩) | Qwen2.5 14B(4-bit)、Llama 3 8B(8-bit) | 更佳推理、較長上下文、較複雜任務 | Qwen2.5-Coder 14B(4-bit) | 4-bit / 8-bit(7–8B) |
16 GB | 13–14B(4-bit 8K ctx OK),7–8B(8-bit/部分 FP16) | Qwen2.5 14B、Llama 2 13B、Gemma 2 9B(8-bit) | 穩定中大型任務、多輪對話、RAG | Qwen2.5-Coder 14B、DeepSeek-Coder-V2-Lite | 4-bit / 8-bit |
24 GB | 30–34B(4-bit),或 13–14B(8-bit) | Qwen2.5 32B(4-bit)、Mixtral 8x7B(4-bit,MoE 需良好實作) | 強推理、較長上下文、工具調用 | Qwen2.5-Coder 32B(4-bit) | 4-bit(大型)、8-bit(中型) |
48 GB | 70–72B(4-bit,4–8K ctx) | Llama 3.1 70B、Qwen2.5 72B(皆 4-bit) | 高品質推理、多語大型對話、進階 RAG | Qwen2.5-Coder 32B 可增 batch | 4-bit |
64–80 GB+ | 70–72B(更長 ctx / 更大 batch),或 30B(8-bit) | 同上,並可拉高 context/batch | 企業級本地部署、長文生成、批量服務 | 同上 | 4-bit / 8-bit(中型) |
下載好,下載的地方會變成「Use in New Chat」

開啟「本地伺服器」
按照步驟開啟

作者:SecBeater
著作權聲明:本文使用 CC BY-NC-SA 4.0 著作權許可,使用請標注出處。
Previous
Gemini_2.5_Flash_越獄指南
Next
LM Studio_基本安裝以及使用教學_Part_1