OPEN SOURCE DEEP DIVE
unsloth:2 倍速、省 70% 显存的微调库,如今是把本地权重接进 Claude Code 与 Codex 的桌面运行时
自称第一个能同时运行与训练模型的桌面应用(Windows/macOS/Linux,多 GPU 与 NVIDIA/AMD/Intel/CPU/Vulkan)。微调宣称快 2 倍、省 70% 显存,后训练菜单覆盖 LoRA/QLoRA/全参/预训练/GRPO/DPO/FP8,导出 GGUF、NVFP4、FP8。Unsloth Start 一条命令把 Claude Code 或 Codex 接到本地权重上;模型清单含 Qwen3.8、GLM-5.3-Flash、Kimi K3、DeepSeek-V4、MiniMax-H3、Gemma 4,另内置私有网页搜索、deep research、自动压缩与 RAG。
从微调库变成桌面运行时:本地模型的 agent 入口
unsloth 现在的自我描述是「第一个能同时运行与训练模型的桌面应用」。这句话比它过去的定位(一个把 LoRA 微调做快做省显存的 Python 库)宽了一整圈:它有 Windows、macOS、Linux x64 与 ARM64 的原生客户端(deb 与 AppImage 都有),也保留一行式安装脚本(curl -fsSL https://unsloth.ai/install.sh | sh、Windows 上 irm ... | iex)与 Docker 镜像。硬件侧支持多 GPU、NVIDIA / AMD / Intel GPU、纯 CPU 以及 Vulkan 后端。
这次转型的实质不是加了个 GUI,而是把「本地跑模型」的出口从 notebook 换成了 agent。README 的 Agents & Tools 一节写得很直接:可以用本地模型驱动 Claude Code、Codex 与 MCP,包含工具调用与代码执行。
# Unsloth Start:一条命令把 Claude Code 接到本地权重上
unsloth start claude --model unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_XL
这一行的意义值得展开:它把「订阅制的云端编码 agent」与「自己机器上的开源权重」拼成了一种新组合——agent 的 harness(上下文管理、工具协议、编辑循环)来自 Claude Code 或 Codex,而推理发生在本地,不产生 token 账单、也不把代码送出去。对本站的分面来说,unsloth 因此同时属于 llm(它改变每 token 成本与可达性)与 code(它是编码 agent 的模型供给端),主能力按契约挂 llm。
训练侧:2 倍速、省 70% 显存,以及完整的后训练菜单
微调仍然是它成名的那件事,宣称口径是「快 2 倍、显存少 70%、无精度损失」。三项里前两项是可复现的工程结果(手写反向传播、避免物化中间激活、融合算子),第三项「无精度损失」是项目方陈述,取决于任务与超参,本站按项目宣称收录。
后训练方法覆盖得比多数同类库全:LoRA、QLoRA、全参微调、预训练、强化学习、GRPO、DPO 与 FP8。GRPO 在列是关键——它是 DeepSeek-R1 之后开源界做可验证奖励 RL 的主流算法,一个消费级微调库把 GRPO 做成开箱可用,等于把 RL 后训练的门槛从集群降到了单卡。导出格式覆盖 GGUF、NVFP4、FP8 等,GGUF 导出直接对接 llama.cpp 生态,NVFP4 则对接 Blackwell 上的服务端引擎——训练完的权重两条部署路线都通。
Data Recipes 支持从 PDF、CSV、DOCX 等文件构建数据集,这是桌面化之后自然会长出来的功能:本地用户手里的数据通常不是 parquet,而是文档。
模型覆盖面:一份当前开源前沿的快照
README 列出的可跑可训模型本身就是一份时间点上的开源前沿清单:Qwen3.8、GLM-5.3-Flash、Kimi K3、Qwen-Image-2.1、MiniMax-H3、DeepSeek-V4、Gemma 4。类型上覆盖 LLM、MLX、GGUF、扩散模型、embedding 与音频模型,图像与视频扩散以及多模态都能跑能训。
除了模型,它还内置了几项通常要靠外部服务补齐的能力:私有且不限量的网页搜索、deep research、自动压缩(滚动上下文窗口)与 RAG。远程访问支持局域网内任意设备,或通过 Cloudflare 的安全 HTTPS 从外网访问本地模型。对外服务走 OpenAI 兼容 API,并且可以把已有的 ChatGPT/Codex 订阅与云服务商接进来——本地与云端在同一个客户端里混用。
它在栈里的位置
把三件事放在一起看才准确:unsloth 是训练侧的显存与速度优化器,是本地推理的桌面运行时,也是编码 agent 的本地模型供给端。它与 llama.cpp 的关系是互补而非替代——llama.cpp 提供最宽的硬件后端与 GGUF 事实标准,unsloth 在其上补齐训练能力、GUI 与 agent 接线,导出格式也以 GGUF 为主。它与 vLLM / SGLang 则基本不在同一岗位:那两个优化集群聚合吞吐,unsloth 优化的是「一个人、一台机器、一个模型」这条路能不能走通。
需要标注的口径:2 倍速与 70% 显存是项目宣称,无第三方统一基准;「无精度损失」在不同任务上结论会不同。可核验的事实是它的方法路线(手写反传、激活不物化、算子融合)、支持的算法清单、导出格式与桌面客户端的存在。