工具推荐
1788776948更新
0
你大概率已经在用某个 AI 编程助手了。让它改 bug、写测试、通读一遍项目代码,确实省事。
但通常会有两件事,会让你在使用这些 AI 编程助手的时候,有些犹豫。一是钱,用得勤一点,API费用蹭蹭的往上涨。另一件是隐私,有些项目里的代码,你不一定愿意让它传到云端。
那,有没有一种更好的办法,让编程助手跑在本地的模型上,免费、私密,同时又不怎么折腾?今天要聊的 Magnitude,解决的就是这个问题。
Magnitude 是一个开源的推理服务器。它可以在你自己的电脑上,挑一个最适合这台机器的本地模型,下载下来、调好、跑起来。

它能解决什么问题?
先从前面的「挑一个最适合的模型」聊起,它几乎藏着本地部署模型的全部麻烦。
本地模型真正的难处,从来不在下载这一步。让人头大的是,你压根不知道哪个模型能在自己这台机器上跑起来,更不知道能跑多快。芯片、内存、内存带宽各不相同,同一个模型丢到不同机器上,表现能差出一大截。普通人没精力研究这些,开发者也未必愿意天天折腾量化方案和上下文长度。
这些麻烦,Magnitude 直接 cover 到了。
安装的时候,它先把你的机器摸一遍,处理器、内存、内存带宽都在探测范围里。它没有固定最低配置的说法,内存越大,能跑的模型就越大。测完之后,它给你一排推荐,每一个都直接配齐了模型、量化方式、上下文长度,一整套搭好的方案。
排序也是照着你的机器算出来的。它综合模型的智能程度、预估生成速度、量化质量,还有你希望给出的上下文长度和内存,排完之后你要做的,只是告诉它你更想要快一点、均衡一点,还是聪明一点。每个选项后面还带着一个速度区间,比如每秒三十多到四十多个 token,让你心里有数。
心里有数了,剩下就是把它跑起来。
选完下载,下载完自动调优。推理引擎是用 Rust 写的,底层基于 llama.cpp,装 Magnitude 的时候引擎就跟着一起装好,不用再单独配什么推理运行时。投机解码、并发这些参数,也都按你这台机器调好。不少本地模型跑起来卡,往往就卡在没调好,这一步它替你补齐了。
跑起来之后,真正的考验是内存。模型不会下载完就常驻在那里,它是按需加载的,助手要用的时候才装进内存,闲下来或者机器内存紧张了再卸掉。这里有个细节,卸载只释放推理占用的那一块内存,下载好的模型文件还在,你选中的模型也还是选中的,下次要用再加载就行。万一加载或者运行的时候内存低到了危险线,它会主动把模型停下来,宁可这一下不跑,也不把整台电脑拖崩。
内存这一关过了,还有个换模型的麻烦在前面。不同本地模型之间差异很大,推理格式不同,工具调用的格式不同,聊天模板和历史记录的约定也不同。Magnitude 把这些都归一化,之后你想换个模型,不用改任何代码。

接下来是接到哪里去。Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code,这些助手都在支持列表里,你现在用哪个基本都能接上。要是还没趁手的,Magnitude 自己也带了一个,专门为本地模型优化。
聊到这儿,有个问题几乎每次都会冒出来,有了 Ollama 为什么还要用这个?既然都能跑本地模型,为什么还要多装一层?
答案藏在你的助手身上,它自己并不知道你的硬件,不知道哪个量化方案合适,也不知道跑起来多快。Magnitude 给的是一份针对你这台机器算好的目录和推荐,一个帮你写好助手配置的安装流程,再加上一套为编程助手这种负载专门设计的推理引擎。
怎么部署和用它?
上手有两条路,都不难。
第一条最省事,让你现在的助手帮你装。给它发一句话,让它用 Magnitude CLI 把本地模型配好,剩下的事它自己完成,探测硬件、推荐模型、下载,然后把自己切过去,你基本不用动手。
第二条手动装。在终端里跑 npm 全局安装 @magnitudedev/cli,然后执行 magnitude setup,跟着交互提示一步步选。它会检测硬件、列出推荐、让你挑一个、下载、连到你的助手,最后启动起来直接能用。
装好之后,它就在后台静静地跑,模型按需加载,内存和并发都自动管着。平台方面,macOS 和 Linux 都能用,Windows 走 WSL。
最后说两句。
把整件事顺下来看,Magnitude 做的其实就这一件事。把你机器跑什么模型、怎么调、内存怎么管这些难题全接过去,好让你安心地让编程助手跑在本地,免费、私密。
你要是受够了 API 账单,或者有些代码不想让它离开自己的电脑,不妨试试这个项目。
项目地址:github.com/magnitudedev/magnitude
豫公网安备41010702003375号