DOC软件文档百宝箱

手机本地跑大模型需要什么配置

想在安卓手机上离线跑大语言模型,先弄清一件事:应用本身只是个「运行器」,真正决定体验的是运行内存——模型加载后整个待在内存里,文件多大就要占用差不多的可用内存。这篇文章把内存、存储、处理器三件事讲清楚,帮你判断自己的手机能跑多大的模型。

更多相关说明可看 Local AI 安卓版介绍,那里有功能展示与安装入口。

一、看可用内存,别看标称内存

系统自己也要占一块内存,8 GB 标称的手机通常只剩 4~5 GB 可用。挑模型前先去开发者选项或用工具看看实际可用量,再对照下面的社区经验值(按常见 Q4 级量化估算):

手机标称内存建议参数量模型文件大约体验预期
6 GB1B~2B1 GB 上下速度快,质量有限
8 GB3B 上下2 GB 上下日常问答够用
12 GB4B~7B(7B 偏紧)3~4.5 GB需要清后台,中上体验
16 GB 及以上7B 稳定4~5 GB这类应用的天花板体验

一条实用判据:模型文件多大,加载时就至少需要差不多的可用内存,再留 1 GB 以上给系统和应用本身。加载失败或一对话就闪退,十有八九是这条没满足。

二、存储空间别忽视

每个 GGUF 模型文件 1~5 GB 不等,装几个就是几十 GB 的事。下载或导入前确认剩余存储比模型文件大出一些余量;不用的模型及时删掉,需要时再重新下载或导入。

三、处理器决定「跑多快」

内存决定「能不能跑」,处理器和内存带宽决定「跑多快」。社区实测的常见水平:旗舰机跑 1~3B 量化模型每秒十几个 token,中端机每秒 5~10 个,仅供参考。几个改善体感的做法:

四、量化档位怎么挑

同一个模型往往有多个量化版——把模型压缩变小的产物,文件名里带 Q4_K_M、Q8_0 这类字样。压缩率越高文件越小、质量损失越多:

量化等级文件体积质量建议
Q2 / Q3 系最小明显下降内存极紧时的保底选择
Q4_K_M中等日常够用多数手机的第一选择
Q5 / Q6 系更大更好内存充裕的旗舰机再考虑
Q8_0大接近无损12 GB 以上内存再考虑
F16 / BF16原始大小无压缩手机上不建议

拿不准就从 Q4_K_M 开始,体验有富余再往上升。

五、按用途挑模型系列

能装进手机的覆盖通义千问(Qwen)、DeepSeek、Llama 等主流系列的 GGUF 版本,都能在魔搭社区(ModelScope)搜到。常见的搭配思路:

机型定下来之后,模型从哪来、怎么装进手机,见GGUF 模型下载与导入手机教程;想先整体了解这类离线助手是什么,看安卓离线AI对话助手怎么选。

同站更多