封面:LM Studio_模型選擇&本地伺服器_Part_2

LM Studio_模型選擇&本地伺服器_Part_2

模型選擇

安裝好之後,要如何去選擇更多的模型呢?
點此:
notion image
再來可以選「下載次數最多」的來使用
notion image
如果顯示卡記憶體不足,也可以選小型模型使用例如:「gemma-3-4b」,點右下角下載就會自動下載了
notion image
大家會問說,那我應該選擇哪個模型好呢?這邊給一個對照表給大家參考:
VRAM 區間
建議模型上限(參考)
範例模型(指令/聊天向)
合適任務
範例模型(程式/工具向)
建議量化
≤ 4 GB
1–3.8B
Llama 3.2 1B、Qwen2.5 1.5B、Phi-3 mini 3.8B(勉強)
超輕量聊天、摘要、簡單分類,多語基礎
Qwen2.5-Coder 1.5B
GGUF 4-bit(q4_k_m/q5_k_m),KV Cache 壓縮
6 GB
7–8B(2–4K ctx 較穩)
Mistral 7B Instruct、Llama 3.1 8B(ctx 別太長)
一般聊天、基礎推理、英文/中英雙語
DeepSeek-Coder 6.7B、Qwen2.5-Coder 7B
4-bit
8 GB
穩定跑 7–8B(4–8K ctx)
Qwen2.5 7B Instruct、Llama 3.1 8B、Mistral 7B
多語對話、摘要、RAG 前端模型
Qwen2.5-Coder 7B、DeepSeek-Coder 6.7B
4-bit(或8-bit跑 3–7B)
12 GB
10–14B(4-bit),或 7–8B(8-bit 更穩)
Qwen2.5 14B(4-bit)、Llama 3 8B(8-bit)
更佳推理、較長上下文、較複雜任務
Qwen2.5-Coder 14B(4-bit)
4-bit / 8-bit(7–8B)
16 GB
13–14B(4-bit 8K ctx OK),7–8B(8-bit/部分 FP16)
Qwen2.5 14B、Llama 2 13B、Gemma 2 9B(8-bit)
穩定中大型任務、多輪對話、RAG
Qwen2.5-Coder 14B、DeepSeek-Coder-V2-Lite
4-bit / 8-bit
24 GB
30–34B(4-bit),或 13–14B(8-bit)
Qwen2.5 32B(4-bit)、Mixtral 8x7B(4-bit,MoE 需良好實作)
強推理、較長上下文、工具調用
Qwen2.5-Coder 32B(4-bit)
4-bit(大型)、8-bit(中型)
48 GB
70–72B(4-bit,4–8K ctx)
Llama 3.1 70B、Qwen2.5 72B(皆 4-bit)
高品質推理、多語大型對話、進階 RAG
Qwen2.5-Coder 32B 可增 batch
4-bit
64–80 GB+
70–72B(更長 ctx / 更大 batch),或 30B(8-bit)
同上,並可拉高 context/batch
企業級本地部署、長文生成、批量服務
同上
4-bit / 8-bit(中型)
下載好,下載的地方會變成「Use in New Chat」
notion image

開啟「本地伺服器」

按照步驟開啟
notion image
 
作者:SecBeater
著作權聲明:本文使用 CC BY-NC-SA 4.0 著作權許可,使用請標注出處。

Previous

Gemini_2.5_Flash_越獄指南

Next

LM Studio_基本安裝以及使用教學_Part_1

留言