KoboldCpp

一句话定位:llama.cpp 系的 C++ 本地 LLM 推理后端——单 exe 内置 CUDA,同时暴露 KoboldAI API、OpenAI 兼容 API、Ollama 模拟接口,是「本地模型跑团」的关键底座。 类型:本地 LLM 推理服务 · 开源 · 许可:AGPL-3.0 · 仓库LostRuins/koboldcpp

1. 项目概述

KoboldCpp 由 KoboldAI 社区开发,目标是把「跑 LLM」这件事做到最省事:一个约 600MB 的 Windows 单文件 exe(PyInstaller 打包,内嵌 CUDA 运行时 DLL),双击/命令行即可加载 GGUF 量化模型,不需要 Python 环境、不需要显卡驱动外的任何依赖。它同时是 SillyTavern 等前端最常用的本地后端之一。

对 AI 跑团的定位:它不做故事,只做「模型伺服」。把 Qwen/Llama/Mistral 等指令模型的 GGUF 加载到显存后,任何支持 OpenAI 兼容协议的前端(SillyTavern、ChatRPG、ai-murder-mystery、diceframe……)都能直接连上它,实现全本地、零 API key 的 AI 跑团。

2. 核心功能

3. 技术架构

4. 本机实测记录(✅ 完整运行)

5. 如何运行(复现)

  1. 下载 最新版 koboldcpp.exe(Windows 单文件);
  2. 下载 GGUF 模型(HF 或 ModelScope,如 Qwen2.5-3B/7B-Instruct q4_k_m);
  3. koboldcpp.exe --model <模型.gguf> --gpulayers 99 --port 5001
  4. 前端接 http://127.0.0.1:5001/v1(OpenAI 兼容)或打开 http://127.0.0.1:5001 用内置 UI。

6. 优劣势分析

优势 劣势
零依赖单文件、Windows 开箱即用 Windows 版启动需解压 DLL(受限环境需放行)
一模型四协议,兼容几乎所有前端 单实例单模型(换模型需重启)
显存利用高效(llama.cpp 核心) 无模型管理/热加载(对比 Ollama)
完全离线、数据不出本机 推理速度受硬件上限约束

7. 参考链接