手机本地跑大模型需要什么配置
想在安卓手机上离线跑大语言模型,先弄清一件事:应用本身只是个「运行器」,真正决定体验的是运行内存——模型加载后整个待在内存里,文件多大就要占用差不多的可用内存。这篇文章把内存、存储、处理器三件事讲清楚,帮你判断自己的手机能跑多大的模型。
更多相关说明可看 Local AI 安卓版介绍,那里有功能展示与安装入口。
一、看可用内存,别看标称内存
系统自己也要占一块内存,8 GB 标称的手机通常只剩 4~5 GB 可用。挑模型前先去开发者选项或用工具看看实际可用量,再对照下面的社区经验值(按常见 Q4 级量化估算):
| 手机标称内存 | 建议参数量 | 模型文件大约 | 体验预期 |
|---|---|---|---|
| 6 GB | 1B~2B | 1 GB 上下 | 速度快,质量有限 |
| 8 GB | 3B 上下 | 2 GB 上下 | 日常问答够用 |
| 12 GB | 4B~7B(7B 偏紧) | 3~4.5 GB | 需要清后台,中上体验 |
| 16 GB 及以上 | 7B 稳定 | 4~5 GB | 这类应用的天花板体验 |
一条实用判据:模型文件多大,加载时就至少需要差不多的可用内存,再留 1 GB 以上给系统和应用本身。加载失败或一对话就闪退,十有八九是这条没满足。
二、存储空间别忽视
每个 GGUF 模型文件 1~5 GB 不等,装几个就是几十 GB 的事。下载或导入前确认剩余存储比模型文件大出一些余量;不用的模型及时删掉,需要时再重新下载或导入。
三、处理器决定「跑多快」
内存决定「能不能跑」,处理器和内存带宽决定「跑多快」。社区实测的常见水平:旗舰机跑 1~3B 量化模型每秒十几个 token,中端机每秒 5~10 个,仅供参考。几个改善体感的做法:
- 换更激进的量化版本(如 Q4_K_M),文件小一截速度快一截;
- 长时间生成会发热,过热降频后速度明显掉——休息一会儿再继续;
- 生成中保持亮屏、插着电用,部分机型熄屏后会限制性能;
- 跑长会话前关掉后台大应用释放内存。
四、量化档位怎么挑
同一个模型往往有多个量化版——把模型压缩变小的产物,文件名里带 Q4_K_M、Q8_0 这类字样。压缩率越高文件越小、质量损失越多:
| 量化等级 | 文件体积 | 质量 | 建议 |
|---|---|---|---|
| Q2 / Q3 系 | 最小 | 明显下降 | 内存极紧时的保底选择 |
| Q4_K_M | 中等 | 日常够用 | 多数手机的第一选择 |
| Q5 / Q6 系 | 更大 | 更好 | 内存充裕的旗舰机再考虑 |
| Q8_0 | 大 | 接近无损 | 12 GB 以上内存再考虑 |
| F16 / BF16 | 原始大小 | 无压缩 | 手机上不建议 |
拿不准就从 Q4_K_M 开始,体验有富余再往上升。
五、按用途挑模型系列
能装进手机的覆盖通义千问(Qwen)、DeepSeek、Llama 等主流系列的 GGUF 版本,都能在魔搭社区(ModelScope)搜到。常见的搭配思路:
- 中文写作、日常问答:Qwen 系列小参数版,中文表现好;
- 解题、推理:DeepSeek 系列小参数版,推理强但速度慢一些;
- 老设备、求快:1.5B 及以下任何系列,响应快;
- 识图、看图:带视觉能力(vision)的模型,普通文本模型不认图。
机型定下来之后,模型从哪来、怎么装进手机,见GGUF 模型下载与导入手机教程;想先整体了解这类离线助手是什么,看安卓离线AI对话助手怎么选。