2026 年 10 月 8 日——Unsloth 于 10 月 8 日发布 v0.1.904-beta 更新,官方宣布其开源仓库与桌面端现已支持在本地训练决策模型(Decision Model):通过 Clef head 配合 LoRA 微调,可将 Qwen3.8、Gemma 4 等任意文本或多模态 LLM 转换为 Jev 风格的决策模型。官方基准显示,Qwen3.5-0.8B 在 4GB 显存下训练 42 分钟,三个决策基准的综合准确率从 20.7% 提升至 74.3%,下游任务准确率最高达 78%。
此前决策模型的获取方式主要是下载现成开源权重(如 Cloudflare 的 Clef、上海 AI 实验室的 Intern-Decision),此次更新后,开发者可以用自己的数据集把普通 LLM 改造成决策模型,训练、测试、导出和服务全部在 Unsloth 内完成。
本地训练决策模型正式开放
Unsloth 官方更新日志显示,本次 v0.1.904-beta 版本的核心变化是「Train your own Decision model」:任意文本或视觉 LLM 都可以在 Unsloth 内转换为 Jev 风格的决策模型,官方宣传口径为「决策准确率从 30% 提升到 80%」。训练完成后,模型可以直接在 Unsloth 的 Decision API 中测试、导出和部署。
官方文档《Train your own Decision Model with Unsloth》确认,Qwen3.8、Gemma 4 系列 LLM 均可通过 Clef head 微调得到决策模型,Unsloth 能微调的其他 LLM 也可以用同样方式转换;现有的决策模型(如 Laya、Clef)还能在此基础上继续微调。Unsloth 团队成员 Daniel Han 表示,Qwen、Gemma、Llama 系列均已完成转换,可在 Unsloth Desktop 中试用,官网提供训练指南和 Notebook。
综合准确率从 20.7% 提升到 74.3%
官方用 Clef head 配合 LoRA(r=64)只训练一个 epoch,即把下游准确率从 30-37%(官方说明这大致相当于随机猜测水平)提升至最高 78%。以 Qwen3.5-0.8B 为例,其在三个决策基准上的成绩为:
| 基准 | 训练前 | 训练后 |
|---|---|---|
| typed-decisions | 36% | 73% |
| BANKING77 | 7% | 74% |
| CLINC150 | 19% | 76% |
| 三基准综合准确率 | 20.7% | 74.3% |
数据来源:Unsloth 官方文档。测试集共 3000 行(typed-decisions 2000 行、BANKING77 500 行、CLINC150 500 行),官方说明测试集已针对训练数据做过去污染(decontamination)处理。
多模型的显存占用与训练时长方面,官方给出的基准如下:
| 模型 | 测试准确率 | 显存占用 | 训练时长 |
|---|---|---|---|
| Qwen3.5-0.8B | 78% | 4GB | 42 分钟 |
| Qwen3.5-2B | 81% | 8GB | 40 分钟 |
| Llama 3.2 3B | 79% | 4.1GB | 30 分钟 |
| Gemma 4 E4B | 77% | 14.4GB | 49 分钟 |
| Laya(继续微调) | 77% | 2.5GB | 10 分钟 |
官方基准中训练 Qwen3.5-0.8B 只需 4GB 显存;据中文科技媒体报道,Unsloth 团队的 Daniel Han 称最低 3GB 显存即可完成训练。作为对照,继续微调现成的 Laya 决策模型仅需 2.5GB 显存和 10 分钟。
Clef head 的工作原理
按官方文档说明,Unsloth 将输入状态(state)与所有问题及其选项放进同一个提示词,LLM 只读取一次;一个小型打分头(head)——与 Cloudflare Clef 的打分头同一设计——读取 LLM 在每个问题和选项上的输出,对每个选项打分,并联合决定所有问题。整个过程不生成任何文本,因此不必为逐 token 的文字预测花费显存,这也是 4GB 显存门槛得以成立的关键。
决策输出沿用 Jev 协议的三种问题类型:choice(从命名选项中选一个,返回各选项概率与置信度)、score(按有序等级打分,返回各等级概率与期望分数)、noul(是非判断,返回为真的概率)。训练完成后,官方还提供校准步骤(calibrate),依据留出集数据调整模型的概率输出,使其置信度与实际正确率匹配。
训练数据格式与 Laya、Clef 相同:每行包含一个状态、待决策的问题和标准答案。官方本次训练混合了 typed-decisions 与 ag_news、arc、banking77、boolq、clinc150、commonsense_qa、mmlu、mnli、prompt_injections、snli、sst5、wanli 共 12 个数据来源。
背景:Clef 与决策模型赛道
此次 Unsloth 支持的「Clef head」源自 Cloudflare 于当地时间 10 月 1 日开源的决策模型 Clef(谱号)。该系列包含两款模型:Clef 基于 Qwen3.8-27B 加 LoRA,定位高精度版;Clef-flash 基于 Qwen3.5-9B 加 LoRA,定位低延迟版,在 Cloudflare 生产环境中位延迟为 38.8 毫秒。据 IT之家报道,在 Jev 决策指数(Jev Decision Index 0.2.1)基准评测中,Clef 处于领先地位,并以 Apache 2.0 协议开源。
决策模型的核心思路是不做长链推理和文本生成,只做快速、结构化的判断,直接输出代码可消费的类型化结果。近半月内该赛道密集更新:Typesafe AI 的 Jev 提出这一模型形态并开源,StartLux 开源了 0.8B 到 27B 五档的 StartLux-Decision,上海 AI 实验室发布 Intern-Decision,Cloudflare 带着 Clef 入场,llama.cpp 也在 10 月 2 日合并 PR #29818 使 llama-server 原生提供 SystemOne 端点(/v1/systemone),次日通过 PR #29831 加入 Clef 支持。Unsloth 本次更新补上了「自己训练」这一环,使决策模型的本地闭环从运行延伸到训练。
使用方式
官方提供两条路径。图形界面方面,在 Unsloth Desktop 的 Train 页签选择一个 LLM,将「Train as」设为「Decision model」即可,官方默认填充推荐参数;如需复现官方成绩,将 epochs 设为 2、LoRA rank 设为 16、学习率设为 2e-4。代码方面,通过 FastDecisionModel 与 DecisionTrainer 接口训练,示例如下:
from unsloth import FastDecisionModel, DecisionTrainer, is_bfloat16_supported
from datasets import load_dataset
from transformers import TrainingArguments
model, tokenizer = FastDecisionModel.from_pretrained(
model_name = "unsloth/Qwen3.5-4B",
max_seq_length = 2048,
load_in_4bit = True,
)
model = FastDecisionModel.get_peft_model(model, r = 16, lora_alpha = 16, lora_dropout = 0)
dataset = load_dataset("LocalLLaMA/typed-decisions", "all", split = "train")
items, report = FastDecisionModel.build_dataset(dataset, tokenizer, model)
train_items, eval_items = FastDecisionModel.split_holdout(items, seed = 3407)
trainer = DecisionTrainer(
model = model,
processing_class = tokenizer,
train_dataset = train_items,
eval_dataset = eval_items,
args = TrainingArguments(
per_device_train_batch_size = 8,
gradient_accumulation_steps = 4,
num_train_epochs = 2,
learning_rate = 2e-4,
output_dir = "outputs",
),
)
trainer.train()
训练好的模型可通过环境变量 UNSLOTH_SYSTEMONE_MODEL 挂载到 Unsloth 的 Decision API:请求中使用 laya、default 或 jev-latest 作为模型名时,将自动路由到自训练的决策模型,返回格式与 Laya 一致,现有按 Jev 协议编写的客户端可零改动接入。
官方同时提示两点训练细节:其一,官方基准成绩来自 LoRA r=64 训练一个 epoch 的配置,而文档推荐配置为 rank 16 训练两个 epoch,两者口径不同;其二,想快速体验可将 max_steps 设为 60,Qwen3.5-4B 在 L4 GPU 上 10 分钟即可达到 76% 准确率。
举手提问