2026 年最佳本地 LLM 工具:运行时、应用程序和代理
编辑部 · 发布 2026/08/20 · 更新 2026/08/20

2026 年 8 月 19 日更新:首次发布。截至目前的研究。在自己的硬件上而不是在浏览器选项卡中运行语言模型有四个原因,其中只有一个是意识形态的。隐私:您交给本地模型的文档永远不会离开机器,这是客户代码、合同、患者数据和未发布产品的整个对话。成本结构:云人工智能是计量的,代理工作负载以足够快的速度增加代币数量,以至于有能力的工作站可以收回成本;
2026 年 8 月 19 日更新:首次发布。截至目前的研究。
在自己的硬件上而不是在浏览器选项卡中运行语言模型有四个原因,其中只有一个是意识形态的。隐私:您交给本地模型的文档永远不会离开机器,这是客户代码、合同、患者数据和未发布产品的整个对话。 成本结构:云人工智能是计量的,代理工作负载以足够快的速度增加代币数量,以至于有能力的工作站可以收回成本;您拥有的硬件以电价运行。可用性:无速率限制,无中断,周二不会有更改您工作流程的弃用电子邮件。 和控制:您验证的模型就是您运行的模型,直到您另有决定为止。
平衡的是前沿云模型仍然更强大,对于长期代理工作来说,差距是真实的。本地模型达到同等水平的是有限的工作:聊天、总结、单文件代码和文档问答。这恰好是大多数人整天所做的大部分事情。 如果您的驱动程序不惜一切代价实现最大功能,请使用云。如果您的驱动程序是隐私、成本或控制,那么本地今天是可行的,而此页面就是地图。
这个框架应该设定你的硬件预算,因为本地人工智能支出首先是内存决定。 16GB VRAM 或 32GB 统一内存涵盖 7 至 8B 级别,可处理上述有限工作。 24 至 32GB 的 VRAM,或统一为 48GB,达到 30B 级别,代理编码不再是演示。 96 至 128GB 统一内存运行接近前沿质量的 100B 以上型号。过度购买会带来你可能没有注意到的速度;购买不足意味着您想要的模型类根本不会加载。我们的本地 AI 最佳笔记本电脑和本地 AI 板最佳台式机按级别对机器进行排名。 本页介绍了在它们上运行的内容。
软件方面还没有像硬件那样成熟。今天,您在搜索结果中发现推荐的工具中,大约有三分之一已经失效,并且大多数推荐它们的页面都没有注意到。
本页面跟踪截至 2026 年 8 月哪些工具可以工作以及在哪些硬件上运行。我们目前按 GitHub 星级进行排名,因为它是一个中立且可验证的信号,当工具是闭源且没有星级数时我们会说。表中的每个工具名称都链接到其官方下载。 当我们对每个平台进行实验室测试时,指南栏会填写实际设置演练和我们自己的数字。
此页面的三个规则。首先,我们区分本地模型和本地代理。多个产品在您的计算机上运行,而每个推理调用都会发送到供应商云;这是一种隐私态度,而不是离线功能,这些工具单独列在底部而不是删除。 其次,每个条目都具有实际的最低硬件配置,因为如果没有内存数字,“它在笔记本电脑上运行”就没有意义。第三,我们在常见问题解答中跟踪死亡的情况并附上日期。
精选

最佳整体本地法学硕士运行时:Ollama
默认答案,也是大多数其他工具与之对话的答案。 MIT 许可,大约有 179,000 个 GitHub star,现在它与 CLI 一起提供桌面 GUI。 它使用一个命令拉取模型,在本地主机上公开 OpenAI 兼容端点,并于 2026 年 1 月添加了 Anthropic Messages API 兼容性,这就是人们现在将 Claude Code 指向本地模型的方式。最低配置:3B 型号为 8GB 系统 RAM,7-8B 型号为 16GB,30B 型号为 24GB VRAM。
最适合基准测试硬件:LM Studio
封闭源代码,因此它没有明星数量,但无论如何它都赢得了自己的位置。 LM Studio 捆绑了 llama.cpp 和 MLX,并公开了在测量机器而不是使用机器时重要的控件:GPU 卸载层、量化选择、上下文长度和多 GPU 行为。 自 2025 年 7 月起,它一直免费用于商业用途。这是我们工作站和笔记本电脑主板上大多数每秒令牌数背后的工具。最低:16GB 内存; 24GB VRAM 或 32GB 统一内存很有趣。

最佳底层引擎:llama.cpp
此页面上的几乎所有其他内容都是 llama.cpp 的下游。麻省理工学院许可,大约 124,700 颗星,每天发布多个标记版本。 由于特定原因,它对硬件受众很重要:后端列表非常庞大,涵盖 CUDA、ROCm、Metal、Vulkan、SYCL、CANN 和 OpenCL,供应商工程师现在直接对其进行优化。 构建 8688 中的 Intel Arc 预填充改进价值约为 5 倍,每个 Ollama 和 LM Studio 用户无需安装任何东西即可获得它。最低限度:仅在CPU上运行; 8GB RAM 可用。
最佳本地优先桌面应用程序:Jan
Apache 2.0,大约 44,100 颗星,截至 2026 年 7 月 v0.8.4。Jan 捆绑了 llama.cpp,因此无需安装其他任何东西,并且只需拔出网线即可使用。这听起来像是一个很低的门槛,直到您检查此类别中有多少应用程序是具有 Ollama 字段的云客户端。 这是交给一位永远不会打开终端的同事的。文档 RAG 是其弱点。最低:8GB 内存。
最佳本地文档 RAG:AnythingLLM
麻省理工学院,大约 64,800 颗星。它捆绑了一个矢量数据库,无需配置即可处理分块和嵌入,这使其成为桌面类中最交钥匙的文档聊天。 我们不会埋葬两件事:2026 年 3 月评级为 CVSS 9.6 的漏洞允许由模型自己的流式响应触发远程代码执行,已在 1.11.2 中修复,因此请在使用之前进行更新。默认情况下,遥测功能会在标为“本地优先”的应用程序中启用,您可以在“设置”中将其关闭。 最低:16GB RAM 用于文档工作。
最佳自托管多用户:Open WebUI
大约有 149,000 颗星,这里有最深入的检索配置,v0.11.0 将于 2026 年 7 月发布。它是一个自托管服务器,而不是桌面应用程序,因此 Docker 是入口点。 在您进行构建之前需要了解一件事:该许可证于 2025 年 4 月从 BSD-3 更改为未经 OSI 批准的自定义许可证,添加了一项反对删除 Open WebUI 品牌的条款,并在任何 30 天的时间内限制了 50 个以下的用户。不加修改地小规模运行它,对您来说没有任何改变。 最小值:单独的运行时加上容器的 4GB。
最佳本地编码代理:Cline
Apache 2.0,大约 63,900 颗星。 Cline 在本地路径上做了比任何竞争对手更多的实际工程,包括专门为 Ollama 和 LM Studio 构建的紧凑系统提示以及每个模型系列的本机工具调用。他们自己的文档对于云仍然获胜的地方异常坦率。 最低:24GB VRAM 或 36GB 统一内存,并将上下文设置为 32K 或更高。
最佳离线终端编码:Aider
Apache 2.0,大约有 48,300 颗星,在架构上是最可靠的本地选项,其原因值得理解。 Aider根本不使用JSON工具调用。它从纯文本中解析差异和整个文件编辑格式,这避免了破坏本地模型上大多数代理的确切故障模式。 需要注意的是维护:96% 的提交都是由一位作者编写的,发布节奏已缩减到 2026 年大约只有一个稳定版本。最低要求:24GB VRAM 或 36GB 统一。
最佳自托管代理平台:OpenHands
麻省理工学院,大约 84,500 颗星。 OpenHands 正确记录本地模型,更有用的是,当问题不在于您的设置时,它会告诉您:它自己的文档指出,如果代理的行为像聊天机器人或不断出现工具故障,则模型就是限制。它需要最小 22K 上下文并建议 32K。 最低:量化模型需要 24GB VRAM,或 64GB 统一内存。
最佳免费离线惊喜:GitHub Copilot CLI
自 2026 年 4 月起,Copilot CLI 针对 Ollama、vLLM 和 Foundry Local 运行。 GitHub 身份验证是可选的,并且不需要 Copilot 订阅。设置 COPILOT_OFFLINE 会停止所有遥测和网络联系,并且其子代理会继承您的本地提供商。 大多数比较文章仍然将其列为仅限云。请注意这种划分:即使在自带密钥的情况下,IDE 扩展仍然会将内联完成发送到云。最低:具有 128K 上下文窗口的模型,因此统一 32GB VRAM 或 64GB。
最佳供应商支持的服务器:Lemonade
Apache 2.0,大约 5,400 颗星,是这里我们根据优点而不是硬件忠诚度推荐的唯一与供应商相邻的工具。 AMD 工程师对其进行维护,并在 NVIDIA CUDA、Apple Metal、Vulkan 和普通 CPU 以及 Radeon 和 Ryzen AI NPU 上运行。 它大约每两周发布一次,并于 2026 年 4 月将其桌面应用程序从 Electron 迁移到 Tauri。最低配置:16GB RAM; NPU 路径的 Ryzen AI 300 系列或更高版本。
最佳文件系统范围本地 RAG:Nexa AI Hyperlink
闭源且免费。它对设备上的整个文件系统进行索引,并通过内联引用进行回答。 它之所以出现在这个列表中,是因为它是唯一一个在消费类硬件上公布了加速数据的新本地 RAG 工具:在 RTX 5090 上索引速度提高了大约 3 倍,推理速度提高了 2 倍,处理 1GB 文件夹的速度从大约 15 分钟缩短到了四到五分钟。最低要求:现代 RTX GPU; 16GB 内存。
运行时:实际运行模型的内容
这是发动机。接下来两个表中的所有内容都是与其中之一对话的前端。由 GitHub 明星订购。
桌面应用程序和本地 RAG
读者安装的应用程序。 Local-First 列是需要仔细阅读的列:它将在您的计算机上运行模型的软件与添加 Ollama URL 字段的软件分开。
编码和代理工具
这些是页面上最需要硬件的条目,因为代理工作需要大的上下文窗口和长时间的会话。将 32GB VRAM 或 64GB 统一内存视为不再是演示的点。
供应商举措
每个芯片和操作系统供应商都会为本地人工智能提供一些产品,并且该类别值得拥有自己的产品线,因为命名令人困惑且死亡率很高。 2026 年的模式是一致的:供应商停止与第三方堆栈竞争并开始为其提供支持。 NVIDIA 取消了自己的两款本地 AI 产品,现在发布了针对 Ollama、llama.cpp 和 ComfyUI 的优化。 AMD 与 LM Studio 联合品牌。高通通过移植别人的应用程序来提供其 NPU 功能。
供应商工具可以做 Ollama 和 LM Studio 无法做的一件事:到达 NPU。 llama.cpp 没有 NPU 后端,因此在 Snapdragon 或 Ryzen AI 机器上,这些工具使神经引擎的利用率为零。如果您支付了 40 到 60 TOPS,则只有供应商路径使用它。不过,设定期望。 NPU 目前在 7B 型号左右表现最佳,其优势在于始终在线的小型型号工作时的电池寿命,而不是吞吐量。独立 GPU 每次都在速度上击败 NPU。
关于命名的注释。 NVIDIA 的“RTX AI Garage”听起来像是一款产品,但其实并不是。这是一个博客系列。 Microsoft 的堆栈已多次重命名:Copilot Runtime API 变成了 Windows AI API,Azure AI Foundry 变成了 Microsoft Foundry,DirectML 现在处于维护模式,仅进行安全修复。 Qualcomm AI Hub 是一项远程配置物理设备的云服务,而不是本地运行的服务。
通常会出现什么问题

大多数报告称本地模型“不起作用”是配置问题,而不是模型问题。其中四个尤其占据了很大一部分,所有这四个都是硬件观众在指责芯片之前应该了解的事情。
-
Ollama 默认为 4,096 个令牌上下文。当您超过它时,它不会抛出错误。它静静地截断,一个代理循环静静地死去。每个严肃的工具都需要更多:OpenHands 需要至少 22K,建议 32K,Codex 需要 32K,Copilot CLI 需要 128K,Cline 设置 262,144。 此单一设置可能是您在网上找到的故障报告的最常见原因。
-
KV 缓存量化会具体降低工具调用的性能,并且会在总体输出质量明显受到影响之前发生这种情况。 llama.cpp 文档直接对此发出警告。如果您正在运行代理,请将其关闭。
-
工具数量是悬崖,而不是斜坡。 上面,大约有五到六种工具在范围内;一些模型默默地停止发出有效的 JSON 工具调用,并开始在响应正文中嵌入 XML,该工具将其读取为“未使用工具”。一位受欢迎的代理商默认发货了 11 种工具,并在 2026 年初之前打破了自己推荐的模型。 实际后果是违反直觉的:加载许多 MCP 服务器对本地模型来说是非常有害的,而对前沿模型来说则不然。
-
Q4_K_M是实用楼层。在它之下,工具调用的可靠性比一般质量下降得更快,因此该模型听起来仍然不错,但悄悄地没有做任何事情。
内存是限制
在此页面上的每个工具中,决定您可以运行什么的问题是加速器可以看到多少内存。这些是我们在代理工作中最常引用的配对,也是我们打算在实验室中验证的配对。

值得一提的是,因为营销并不:最大的开放式重量模型不是工作站模型。 GLM-5.2 大约有 744B 参数,FP8 需要 744GB 左右,FP8 是一个 8 个 GPU 的数据中心节点。 Kimi K2 和 DeepSeek V4 属于同一类别。 任何告诉您在桌面上运行这些程序的指南都是错误的。
上述吞吐量数据取自已发布的第三方测试和供应商材料,并非 StorageReview 实验室结果。当每个平台经历指南流程时,我们将用我们自己的号码替换它们。
云优先工具以及为什么它们没有在这里排名
大多数人工智能用户都熟悉流行且易于使用的在线人工智能工具。本地代理不是本地模特。其中每个都在您的计算机上运行,同时将每个推理调用发送到供应商云。
有一种广泛重复的“将光标连接到 Ollama”指南类型。 Cursor 自己的文档与它们相矛盾。如果您需要离线操作,那么这种区别就是整个过程。
图像和视频生成怎么样?
本地图像生成是本地人工智能中最大的社区之一。仅 ComfyUI 就超过了 GitHub 星级排名之上的大多数工具,而本地视频生成正在成为最需要 VRAM 的消费者工作负载。 它应该有自己的排行榜,而不是附加在这个排行榜上的第四个类别,而且它会得到一个。在此之前,该页面上的硬件逻辑将直接传输:图像和视频工作比语言模型更受内存限制,并且适用相同的层。
此页面如何运作
三个规则。首先,目前排名是根据 GitHub star 进行的。它并不理想,但它是中立的、可验证的,并且不需要我们假装我们已经测试了我们没有测试过的东西。闭源工具是这样标记的,而不是给出发明的分数。 由于我们自己的测试产生了明确的最爱,因此排序将发生变化以反映测量结果,我们会这么说。其次,每个条目都有一个内存最小值,因为这是决定模型是否加载的数字。 第三,指南专栏是一个承诺:每个平台都会获得一个实际设置演练,其中包含我们硬件上的数字,并且在发布时链接会出现在此处。
本地法学硕士工具常见问题解答
我应该从哪个本地 LLM 工具开始?
Ollama(如果您习惯使用终端);LM Studio(如果您希望有一个带有控件的窗口);Jan(如果您想要开箱即用且从不要求您安装任何其他东西)。 这三个都是免费的,所有三个都完全离线运行,并且所有三个都在底层使用 llama.cpp,因此模型行为是相同的。区别在于接口,而不是速度。
NVIDIA ChatRTX、GPT4All 和Continue.dev 发生了什么?
他们和数量惊人的同行一起消失了,这是在遵循旧建议之前需要了解的最有用的事情。 NVIDIA ChatRTX 已于 2026 年 1 月 21 日弃用,其存储库已存档,其支持论坛已锁定,但没有指定替代者。 GPT4All 是最棘手的情况:它在 12 个月内没有提交,最后一次发布是 2025 年 2 月,但存储库未存档,并且仍然显示大量星星,因此它看起来还活着。它只支持一小部分量化格式,并且无法加载大多数当前的模型版本。 Continue.dev 是两年来本地模型编码的标准推荐,被 Cursor 收购并于 2026 年 6 月关闭。Roo Code 于 2026 年 5 月关闭,Void 于 2026 年 6 月归档,Twinny 于 2025 年 11 月归档,Reor 于 2026 年 3 月归档。 Khoj 于 2026 年 4 月关闭了其托管服务,但自托管版本仍然存在。在供应商方面,英特尔 IPEX-LLM 于 2026 年 1 月存档,并标记为已知安全问题,但没有发布迁移路径,NVIDIA RTX AI 工具包于 2025 年 11 月被弃用。
运行本地法学硕士需要多少 VRAM?
对于聊天,8GB 系统 RAM 运行 3B 模型,16GB 系统 RAM 运行 7 至 8B 模型,仅靠 CPU 就可以接受。为了获得有用的速度,您希望模型位于 VRAM 或统一内存中:16GB 可以处理 7 到 14B 级别,24GB 可以在第四季度达到 30B 级别,而 32GB 或更多则可以让代理编码工作不再令人沮丧。 除此之外,容量比带宽更重要,这就是为什么 96 至 128GB 统一内存机器运行的模型是消费类显卡无法支持的。
本地 LLM 工具是否使用我的 NPU?
通常不会。 llama.cpp 没有 NPU 后端,因此 Ollama 和 LM Studio 将在 Snapdragon 或 Ryzen AI 机器上将神经引擎保留为零,并在 CPU 或 GPU 上运行。 目前到达 NPU 需要一条供应商路径:Qualcomm GenieX、带有 NPU 运行时的 AMD Lemonade、Intel OpenVINO 或通过操作系统框架的 Apple 神经引擎。值得了解的是您获得了什么,即电池寿命和低功耗始终在线操作,而不是速度。 如今,NPU 的性能也超过了 7B 模型,而独立 GPU 每次都会在吞吐量方面击败 GPU。
我应该在 Windows 还是 Linux 上运行本地 AI?
对于此页面上的桌面应用程序,Windows 和 macOS 的使用更为流畅。 LM Studio、Jan、AnythingLLM 和 Ollama 都在本机安装,GPU 驱动程序来自常见位置,不需要终端。 Linux 保持了较低的水平:生产服务引擎 vLLM 和 SGLang 是 Linux 优先的,多 GPU 服务有效地假设了这一点,并且一些最新的加速路径先于其他任何地方登陆,包括 AMD 的 Ryzen AI NPU 支持,该支持已到达 Linux 并需要最新的内核。 差距比以前更窄了。 AMD 于 2026 年统一了 Windows 和 Linux 上的 ROCm 版本,WSL2 涵盖了其余大部分内容,这就是 Open WebUI 等基于 Docker 的工具在 Windows 计算机上愉快运行的方式。 实际规则:如果您从桌面应用程序表安装,请保留您拥有的操作系统;如果您正在构建专用服务盒或追求每条加速路径,请在 Linux 上构建它。
本地模型是否足以取代云模型进行编码?
这完全取决于任务,而且这种分歧比大多数报道所承认的要严重。在有界工作、单文件生成、单元测试、样板文件和解释代码方面,良好工作站上当前的开放权重模型与前沿云模型大致相当。 在长期代理工作中,跨大型存储库的多文件重构,它们显然会失败,并且故障模式是令人不快的类型:无声的无操作和自信地报告从未发生过的工作。如果您选择本地化的原因是隐私、气隙要求或成本,那么今天它是可行的。 如果你的理由是能力,那么现在还不是。
在本地运行模型比使用云服务更安全吗?
对于数据驻留,是的,这通常就是重点。为了软件安全,不会自动。 2026 年 3 月评级为 CVSS 9.6 的本地人工智能应用程序可以通过模型自己的流输出驱动在主机上执行代码,因为桌面应用程序是使用不安全的默认值打包的。本地意味着您的数据保持不变。 这并不意味着该软件已经硬化,并且该类别包含大量快速移动的代码。