下载一个 7GB 的模型,跑起来卡成 PPT?先查查你的电脑适合什么
一、你下载过”跑不动”的模型吗?
上周我在 Ollama 上看到一个 13B 的模型,心动了。7GB 的下载量,我在公司午休时间挂着下载,下班回家满心期待地打开终端,输入提示词,然后——
等了三秒,一个字都没出来。
又等了五秒,终于开始一个字一个字地往外蹦,间隔大概两秒一个。我算了一下,这速度大概 0.5 tok/s,比我手写还慢。
这不是我第一次踩坑。Ollama 里几百个模型,每个还分 Q4、Q8、FP16 好几种量化版本。我根本不知道自己的 16GB 内存 MacBook 能跑什么,不能跑什么。每次都是下载一个试试,跑不动就删,再下另一个。一个模型 3 到 7GB,下载半天,跑起来卡成 PPT,再删掉。反复几次,时间全浪费了。
后来我发现了 llmfit。它解决的就是这个问题:不用下载模型,就能知道你的电脑适合跑哪些模型。
二、llmfit:你的本地模型选型军师
图:llmfit 终端 TUI 界面,展示硬件检测后模型评分排序(来源:GitHub 官方仓库)
llmfit 是一个开源的终端工具,GitHub 上已有 33.5k Star,用 Rust 写的,MIT 协议。
项目地址:https://github.com/AlexsJones/llmfit
它的工作方式很直接:检测你的硬件配置,然后扫描模型库里的几百个模型,给你的电脑打分。哪些模型能跑、跑多快、质量如何、上下文多长,全部排好序给你看。
工作原理
自动检测你的 RAM、CPU、GPU、VRAM,然后每个模型在四个维度上打分,从最适配到最不适配排列。
llmfit 的评分不是简单的”能跑/不能跑”,四个维度各有侧重:
| 维度 | 说明 | 意义 |
|---|---|---|
| 内存适配 | 模型大小加量化档位 vs 你的可用内存 | 会不会爆内存 |
| 预计速度 | 基于内存带宽模型加社区实测数据 | 跑起来快不快 |
| 质量 | 模型本身的性能基准 | 生成效果好不好 |
| 上下文 | 能支持多长的上下文窗口 | 能不能处理长文档 |
速度估算这块挺有意思。它不靠猜,而是基于内存带宽模型,结合社区用户在你相似硬件上的实测数据。每个估算结果都标注了假设条件,用 llmfit info 命令可以查看具体是怎么算出来的。
三、上手实测:一条命令找到你的最佳模型
安装
llmfit 的安装方式很全,挑一个顺手的:
# macOS 用户(推荐)
brew install llmfit
# Windows 用户
scoop install llmfit
# 快速安装(全平台)
curl -fsSL https://llmfit.axjns.dev/install.sh | sh
# 或者用 pip
uv tool install -U llmfit
最常用的命令
装好之后,打开终端,一行命令:
llmfit
这就是核心命令,默认进入交互式 TUI 界面。它会自动检测你的硬件,然后从模型库中拉取所有模型,按适配度排名展示给你看。
图:llmfit 的模型适配打分界面,展示每个模型在内存、速度、质量、上下文四个维度的评分(来源:GitHub 官方仓库)
想要更简洁的输出,可以试这几个:
# 只显示适配度最高的模型
llmfit fit
# 输出 JSON 格式,供脚本或 AI 工具调用
llmfit recommend --json
# 查看某个模型在你电脑上的详细分析
llmfit info "qwen2.5:7b"
我实际试了一下。在我的 M1 MacBook Pro 16GB 上跑 llmfit,大概 2 秒就检测完了硬件,然后展示了一个长长的模型列表。排在前面的是 7B 参数的 Q4 量化版本,预计速度 30 到 40 tok/s,内存占用约 5 到 6GB。14B 模型的排名靠后,预计速度降到 10 到 15 tok/s。30B+ 的大模型直接标红——内存不够。
以前我可能要下载三四个模型才能试出来哪个适合,现在一条命令、两秒钟就知道答案了。
四、不止是估算:实测加社区基准
自己跑一次基准测试
llmfit 的估算毕竟是估算。如果你想知道自己电脑上跑某个模型到底有多快,可以用:
llmfit bench
这条命令会在你正在运行的推理服务(Ollama、llama.cpp、MLX 等)上实测 tok/s(每秒生成 token 数)和 TTFT(首 token 延迟)。数据是真实的,不是估算。
把数据贡献给社区
更有意思的是,你测出来的数据可以直接从 TUI 界面提交 PR 回项目。不需要装 gh 命令行工具,不需要第三方账号,在终端里点几下就能完成。下一次发布时,这些数据就会进入社区基准库。以后和你硬件一样的人,就能直接看到你的实测数据,不用自己再跑一遍 benchmark。
支持多种本地推理框架
llmfit 不是只适配 Ollama 的。它支持的运行时包括:
- Ollama:最常见的本地推理框架
- llama.cpp:轻量级 C++ 推理引擎
- MLX:Apple Silicon 专属优化框架
- Docker Model Runner:Docker 容器化推理
- LM Studio:图形化本地推理客户端
不管你用哪个,llmfit 都能识别并给出适配建议。
五、适合谁?不适合谁?
适合你,如果:
- 你在本地部署过大模型,但不知道选哪个量化版本合适
- 你的电脑配置不算顶配(16GB 或 32GB 内存),想知道自己的极限在哪
- 你在 Ollama 上翻来翻去,几百个模型不知道从哪个开始试
- 你经常在不同电脑上跑模型,想快速了解每台电脑的能力上限
可能不适合你,如果:
- 你只用云 API(OpenAI、Claude 等),从不碰本地模型
- 你没有命令行使用经验,看到终端就头疼
- 你的电脑配置很低(8GB 以下内存),能跑的模型非常有限,llmfit 扫完可能直接告诉你没有推荐的模型
六、写在最后
选模型这件事,不应该靠下载试错。几百个模型,每个 3 到 14GB 的下载量,如果全靠试,时间成本太高了。llmfit 把试错变成了计算——检测你的硬件,计算每个模型的适配度,排好序给你看。整个过程只需要一条命令,几秒钟出结果。
如果你已经在本地玩大模型,或者正准备入坑,不妨先装一个 llmfit,跑一下 llmfit 命令,看看你的电脑到底能跑什么,然后再去下载。这样至少不会浪费几个小时下载一个跑不动的模型。
项目信息
- 项目名称:llmfit
- GitHub:https://github.com/AlexsJones/llmfit
- 协议:MIT
- 当前 Star:33.5k+
- 技术栈:Rust
- 安装命令:
brew install llmfit/scoop install llmfit - 支持系统:Windows / macOS / Linux
- 姐妹项目:llmserve(本地模型服务 TUI)、llama-panel(macOS 本地模型管理)
互动时间:你电脑上跑过最大的模型是哪个?参数多大?跑起来卡不卡?评论区聊聊你的配置和体验。
喜欢这款工具?关注「善忘技术夹」全媒体
扫描二维码关注微信公众号与小程序,获取更多高品质开源软件推荐与效率工具测试。