资讯详情

llmfit bench 一条命令实测:本地大模型推理的真实 tok/s 速度

📅 2026/9/11 10:20:12 | 华诺云谱 👁 阅读
llmfit bench 一条命令实测:本地大模型推理的真实 tok/s 速度
llmfit bench 一条命令实测本地大模型推理的真实 tok/s 速度【免费下载链接】llmfitHundreds of models providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit本地推理服务跑通之后下一个问题就是速度这台机器到底能跑多快llmfit bench向正在运行的推理服务发真实请求把 tok/s、首 token 延迟和总延迟直接打出来。一次实测的输出长这样 Benchmark Results Model: Qwen3.5-0.8B-Q8_0.gguf Provider: llamacpp TPS: 31.5 avg (30.1 min / 33.0 max) TTFT: 95 ms avg Latency: 2050 ms avgTPS31.5 即每秒输出约 31.5 个 token30.1 / 33.0 为 3 轮的最低与最高TTFT95 ms 为首 token 等待时间Latency 2050 ms 为整条请求从发出到收完的耗时。为什么要实测llmfit 平时显示的理论 tok/s 由公式推出真实表现还受量化方式、上下文长度、后端实现影响。bench 绕开公式发 4 条真实提示词、3 轮推理外加 1 次热身把三项指标全部实测逻辑在 llmfit-core/src/bench.rs。先让机器跑起来安装 llmfit 的两种方式macOS 和 Linux 都支持任选其一# 方式一官方安装脚本 curl -fsSL https://llmfit.axjns.dev/install.sh | sh # 方式二uv uv tool install -U llmfit让 llama-server 先跑起来bench 测的是活着的推理服务所以先跑模型。以 llama.cpp 为例这条命令加载模型并监听 8080 端口llama-server -m ~/.cache/llmfit/models/Qwen3.5-0.8B-Q8_0.gguf --port 8080 -ngl 99看到 model loaded / listening 即就绪。Ollama、vLLM、MLX 同理llmfit 自动探测不用手动填地址后端默认地址Ollamalocalhost:11434vLLMlocalhost:8000llama-serverlocalhost:8080靠 /props 端点精确识别MLXlocalhost:8080llama-server 和 MLX 同占 8080 端口时llmfit 靠 /props 端点把两者区分开。一条命令三个数字服务就绪后直接运行llmfit bench。它先发一条热身请求不计入统计再跑 3 轮真实推理。Ollama 读 eval_duration 原生计时TTFT 精确到毫秒vLLM、MLX 用墙钟估算TTFT 显示 n/a只出总延迟。TUI 里更省事在 llmfit 终端界面选中已安装的模型按b弹出 Benchmark this model 提示按 Enter 开始实测按 Esc 转后台继续跑。批量测试与预览参数批量测、只预览、免确认把参数拼上就行llmfit bench # 测所有发现的模型并自动提交社区 PR llmfit bench --all --share # 只预览要提交的 JSON不联网 llmfit bench --all --share --dry-run # 跳过确认提示适合脚本/自动化 llmfit bench --all --share --yes--all把所有发现的模型测一遍--share测完把结果提交社区--dry-run只打印将提交的 JSON不联网--yes跳过确认提示适合脚本。完整参数说明见 docs/cli.md。数据不会白跑每次 bench 都先把结果写进本地存档Linux 下位于~/.local/share/llmfit/benchmarks/pending/跳过分享也不会丢。它立刻带来两个变化排行榜顶部多出一行 you (local)你的实测 tok/s 替换掉估算值测的是 1B 参数以上的 dense 模型时还会反向校准同硬件上其他模型的估算公式——测一个准一片。把结果捐给排行榜加--sharellmfit 自动 fork 仓库、提交结果文件并开 PR无需 gh CLI认证走 GitHub 设备码流程或设置 GITHUB_TOKEN。之前跳过的结果单独执行llmfit bench --share就能批量补交。被合并的数据打进下一个版本后同硬件的用户不用自己跑 bench表格里直接显示带 ✓ 的校准值完整流程见 docs/benchmarking.md。常见 3 问Q提示 No inference provider foundA说明没找到任何推理服务。先启动 Ollama、vLLM、MLX 或 llama-server 中任意一个并确认模型已加载再重新运行 llmfit bench。QvLLM、MLX 的 TTFT 显示 n/aA精确 TTFT 依赖流式输出OpenAI 兼容端点目前用非流式请求只显示总延迟Ollama 和 llama.cpp 可以精确测量。Q换了硬件旧数据会干扰吗A不会。记录在其他 CPU/GPU 配置上的运行结果会被自动忽略不会混进当前硬件的展示。跑完这一次 bench你的机器就在社区排行榜上钉下了第一行不靠估算的成绩。【免费下载链接】llmfitHundreds of models providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。