一个文件、零安装:下载即用
官方把它概括为「一个文件、零安装」:Windows 版是一个包含全部依赖的可执行文件,双击运行;Linux 与 macOS 也是单个预编译二进制,下载后赋予执行权限即可。启动时不带参数会弹出图形界面,常用设置集中在预设与 GPU 层数两项,其余细节可查命令行帮助。默认服务地址是本机 5001 端口。这种分发方式的最大好处是省掉了 Python 环境与依赖冲突的麻烦;代价是模型要另外准备——官方明确说明程序不附带模型,需要自行下载 GGUF 文件后加载。
产品情报 / 本地大模型运行工具与多模态前端
KoboldCpp官方描述为「一个文件、零安装」:单个自包含可执行文件基于 llama.cpp 构建,可在 CPU 或 GPU 上运行 GGUF 模型;除文本生成外还集成了图像与视频生成、语音识别与合成、音乐生成与视觉理解,并自带 KoboldAI Lite 界面。

深度介绍
官方把它概括为「一个文件、零安装」:Windows 版是一个包含全部依赖的可执行文件,双击运行;Linux 与 macOS 也是单个预编译二进制,下载后赋予执行权限即可。启动时不带参数会弹出图形界面,常用设置集中在预设与 GPU 层数两项,其余细节可查命令行帮助。默认服务地址是本机 5001 端口。这种分发方式的最大好处是省掉了 Python 环境与依赖冲突的麻烦;代价是模型要另外准备——官方明确说明程序不附带模型,需要自行下载 GGUF 文件后加载。
它基于 llama.cpp 构建,官方称支持全部 GGML 与 GGUF 模型,并对历史上的旧模型保持向后兼容;可以在 CPU 上运行,也可以把全部或部分层卸载到 GPU,显存不够时用部分卸载换取速度。模型文件由使用者自行准备,官方给出的获取途径是 Hugging Face 等站点上搜索 GGUF 文件,并为新手推荐了一个兼顾文字与视觉的多模态模型作为起点。实践中建议先按显存挑量化等级:模型放得下比参数大更重要,放不下时要么降量化、要么只卸载部分层。
除文本外,它把生成式图像与视频能力一并内置:图像侧官方点名支持多种扩散模型(含 SD 1.5、SDXL、SD3、Flux 与若干较新的模型系列),并支持图像编辑与在运行中切换图像 LoRA;视频侧支持若干视频模型,1.119 起加入视频生成与图生视频,1.121 又为其中一个视频模型加入音频片段与多张参考图这类媒体参考能力。生成过程中还有进度与预览显示。需要注意的是这些模型体积大、显存要求高,官方也提供了快速配置模板来降低试错成本;把它们与文本模型同时加载并不现实,通常是分开运行。
语音是另一条完整链路:语音识别走 Whisper,可用于本地转写;语音合成支持多个引擎,官方列出包括 Qwen3TTS、Kokoro、OuteTTS、Parler 与 Dia;此外还支持音乐生成(Ace Step 系列)。对做有声内容、配音或本地语音助手的用户,这意味着不必再拼装多套工具,一个可执行文件就能覆盖转写、朗读与配乐。实际使用时仍要注意算力:语音模型与文本模型同时驻留会显著吃内存与显存,官方在 1.119 里把单次可附加的图片与音频数量上限提高到了 64,但硬件仍然决定可用规模。
它支持多模态视觉理解(可让模型看图),并支持模型上下文协议(MCP)服务器与工具调用;1.120 还加入了用户可自定义的 JavaScript 工具,与标准工具调用兼容,1.121 修复了部分模型的工具调用兼容问题。检索方面提供基于 TextDB 的本地知识检索与联网搜索,1.121 修复了联网搜索的 UTF-8 处理。把这些能力放在本地运行时里,好处是资料与请求都不出本机;需要留意的是联网搜索与外部工具会让本地服务主动访问网络,对隔离环境应当在启动时关掉相关功能。
官方列出的兼容接口相当多:自家的 KoboldCpp 接口,以及 OpenAI、Ollama、A1111/Forge、ComfyUI、Whisper 转写、XTTS 与 OpenAI 语音等风格;1.119 还补上了图像编辑接口。这意味着既有的客户端、插件与脚本大多可以直接把地址指过来使用,不必为本地模型重写调用层。使用时的常规做法是启动时开启需要的接口并设置密钥与监听范围:默认只服务本机,若要给局域网其他设备用,需要显式监听并确认防火墙策略。
界面部分是捆绑的 KoboldAI Lite:提供对话、冒险、指令与写作等模式,以及多套主题;作品层面支持角色卡导入、多种数据格式互通、世界信息、作者注与记忆等长期写作需要的设定,并可导出 JSON 存档与持续连载的故事。它还附带正则处理、采样器调节等进阶选项。对角色扮演与长篇创作的用户,这套功能比通用聊天界面更贴合需求;但界面与后端是一体的,若想用自己的前端,直接走兼容接口即可。
官方在仓库里明确挂出钓鱼警告:koboldcpp.com 不是官方网站,请只从 GitHub 的 Releases 页下载二进制。这条提醒值得认真对待——这类单文件可执行程序一旦下载到仿冒版本,等于把本机权限交出去。此外项目以 AGPL-3.0 许可开源,作为网络服务对外提供修改版时需按该许可开放相应源码;Docker 镜像官方标注「面向专家」,主要用于云 GPU 租用用户,在 Windows 与 macOS 上可能表现不佳,ARM 设备甚至可能直接失败;官方另提供 Colab 笔记本与云 GPU 部署镜像供无本地算力的用户使用。
产品特点
Windows、Linux 与 macOS 都是单个预编译二进制(Linux 另有面向旧机器的兼容版),不需要安装 Python 环境或处理依赖冲突,双击即用;默认在本机 5001 端口提供服务。
在同一个可执行文件里集成扩散模型图像生成与编辑、视频生成与图生视频、Whisper 语音识别、多引擎语音合成与音乐生成,并支持视觉识别,省去拼装多套本地工具。
同时提供自家接口与 OpenAI、Ollama、A1111/Forge、ComfyUI、Whisper 转写、XTTS 与 OpenAI 语音等风格的端点,已有客户端通常改地址即可接入。
仓库首页明确提示 koboldcpp.com 并非官方站点,官方二进制只在 GitHub Releases 分发;这一提醒对单文件可执行程序尤为重要。
最近动态
1.121 为一个视频生成模型加入媒体参考支持,可附加音频片段与多张参考图来生成视频;修复了流式输出中的竞态条件与音频条件化问题,加入视频 LoRA 支持,把面向旧机器的发行版切换到较早的 CUDA 版本,并修复文法记忆化、部分模型的工具调用兼容、数值型接口参数校验与联网搜索的 UTF-8 处理等问题。
1.120 加入 DirectIO 模型载入模式(并允许与内存锁定、内存映射组合),新增对若干新模型的支持;图像生成模块同步更新并修复多处问题,界面同步升级;还加入用户可自定义的 JavaScript 工具,与标准工具调用兼容。官方同时提示部分来源的量化文件存在问题,下载模型时要认准正确的文件。
1.119 加入视频生成与图生视频支持,并新增若干模型与模板、支持特定推理预算;加入两种推测解码方案,把单次可附加的图片与音频数量上限提高到 64,把运行时可加载的图像 LoRA 数量从 4 提到 10,并在图像生成过程中显示进度与预览;接口侧补上图像编辑端点。
发布记录显示 6 月 16 日为 1.117、6 月 28 日为 1.118。核验时最新版本为 1.121(2026 年 9 月)。项目更新频繁,涉及上游合并与新模型适配的条目较多,升级前建议保留可回退的旧版本二进制,并先用较小模型验证加载与接口是否正常。
KoboldCpp 是 LostRuins 维护的本地大模型运行工具,灵感来自早期的 KoboldAI:基于 llama.cpp 构建,官方把它概括为「一个文件、零安装」。Windows 版是包含全部依赖的单个可执行文件,Linux 与 macOS 也提供预编译二进制,下载后直接运行;启动时不带参数会弹出图形界面,默认在本机 5001 端口提供服务,模型则需要使用者自行下载 GGUF 文件。项目以 AGPL-3.0 许可开源,核验时仓库约有 1.2 万 star,最新版本为 1.121(2026 年 9 月),迭代节奏保持在每月左右。 除文本生成外,它的能力面相当宽:图像生成与编辑支持多种扩散模型系列,并可在运行中切换图像 LoRA;视频侧支持若干视频模型与图生视频,1.121 起还能为视频模型提供音频与多张参考图;语音侧用 Whisper 做识别,用多个引擎做合成,另有音乐生成;此外支持多模态视觉理解、模型上下文协议与工具调用、用户自定义 JavaScript 工具、基于本地数据库的检索与联网搜索。官方列出的兼容接口包括自家的 KoboldCpp 接口,以及 OpenAI、Ollama、A1111/Forge、ComfyUI、Whisper 转写、XTTS 与 OpenAI 语音等风格,已有客户端通常改地址即可接入。 界面部分是捆绑的 KoboldAI Lite,提供对话、冒险、指令与写作等模式与多套主题,并支持角色卡导入、世界信息、作者注、记忆与 JSON 存档等长篇创作功能。分发方式覆盖 Windows、Linux(含面向旧机器的兼容版)、macOS、Docker、Colab 笔记本、云 GPU 镜像,以及在 Termux 与树莓派上自行编译。官方也说明了 Docker 镜像主要面向云 GPU 租用用户,在部分平台上可能表现不佳甚至失败。 使用前需要注意:官方在仓库明确提示 koboldcpp.com 不是官方网站,二进制只应从 GitHub Releases 下载——对单文件可执行程序而言,仿冒版本等于直接交出本机权限;程序不附带模型,需自行准备 GGUF 文件并注意来源可靠性(官方也提到部分量化文件存在问题);图像、视频与语音模型体积大、显存要求高,通常与文本模型分开运行;兼容接口默认只服务本机,对外提供时要显式设置监听、密钥与访问控制;许可证为 AGPL-3.0,把修改版作为网络服务提供时需开放相应源码。
核验信息
本页事实来自 KoboldCpp 官方渠道:GitHub 仓库 README(「一个文件、零安装」定位、支持的模态与模型系列清单、兼容接口列表、自带的 KoboldAI Lite 界面与创作功能、各平台安装方式与默认端口、模型获取建议,以及官方挂出的钓鱼站点警告与 Docker 使用警示)与发布说明(1.117 至 1.121 的更新条目与日期)、许可文件(AGPL-3.0),以及官方 Wiki、Docker 镜像与 Colab 笔记本。star 数、版本与功能核验于 2026 年 9 月 22 日,项目更新频繁,请以官方仓库与发布说明为准。
KoboldCpp介绍页面对您是否有帮助?