2026 年 8 月 19 日——小红书 dots 实验室于 8 月 14 日开源 dots3 系列首个开放权重模型 dots3-note preview,并于 8 月 19 日通过 Dots API 开放平台(dots.ai/platform)上线官方 API 调用服务。官方 API 目前限时免费开放,用户注册账号即可获取 API Key 直接调用,无需本地部署。

该模型采用 280B 总参数、16B 激活参数的 MoE 架构,支持 512K 超长上下文与文本、视觉、语音、视频四模态理解,是 dots3 系列(规划包含 note、jazz、aria 三档)中最轻量的版本,主打长程开放域 Agent 任务,继承同系列 dots-note 3.0 在 IMO 2026 国际数学奥林匹克竞赛中获官方认证满分(42/42)的推理基因。模型权重采用 Apache 2.0 协议,在 Hugging Face 与 GitHub 开放下载,华为昇腾 Atlas 800 A3 与 Atlas 900 A3 SuperPoD 已于 8 月 15 日完成全功能适配。

1. API 限时免费

据 dots 实验室官方发布,Dots API 开放平台于 8 月 19 日上线。用户通过小红书账号登录 dots.ai/platform 后,可在 API Keys 栏目创建密钥,直接通过云端接口调用 dots3-note preview 模型。官方 API 目前处于限时免费阶段,开发者可在免费额度内直接调用,无需预先充值或订阅付费套餐。

作为对比,第三方托管平台 DeepInfra 同日上线了 dots3-note preview 的商业托管 API,定价为输入 $2/百万 token、输出 $6/百万 token、缓存命中 $0.20/百万 token。官方 API 的限时免费政策为开发者提供了零成本试用窗口。

限时免费截止时间:截至发稿,官方尚未公布限时免费的具体截止日期,建议关注 Dots API 开放平台官方公告。

2. 开源详情

dots3-note preview 于 8 月 14 日在以下平台同步开放权重,采用 Apache 2.0 许可证:

平台 地址
Hugging Face dots-studio/dots3-note-prev(BF16)
Hugging Face dots-studio/dots3-note-prev-fp8(FP8 量化)
GitHub studio-dots-ai/dots3-note-prev
ModelScope dots3-note preview

官方推荐 FP8 版本在单机 8 卡(如 8×H100)上以 TP=8、EP=8 部署;BF16 版本需要更多显存。模型支持 vLLM、SGLang 与 Transformers 三种推理框架,SGLang 官方提供 lmsysorg/sglang:dev-dots3-note 镜像与 cookbook 配方。

3. 模型规格

项目 数据
模型名称 dots3-note preview
总参数 280B
激活参数 16B
架构 MoE(256 个路由专家 + 1 个共享专家,Top-8 路由)
隐藏层维度 5,120
词表大小 152K
原生上下文 512K Token
注意力机制 MLA 底座 + SWA 与 DSA 混合稀疏注意力
输入模态 文本、图像、视频、音频
视觉编码器 7B 总参数 / 1.2B 激活的 MoE ViT
音频编码器 800M 参数稠密网络
多 Token 预测 1.13B 参数共享 MTP 层,并行预测最多 3 个后续 token
开源协议 Apache 2.0
官方 API 限时免费(dots.ai/platform,8 月 19 日上线)
DeepInfra 托管 API 输入 $2 / 输出 $6 / 缓存 $0.20(每百万 token)

4. 核心能力

据官方模型卡与发布信息,dots3-note preview 在以下方向做了针对性优化:

长程开放域 Agent。区别于数学、代码等标准化场景,模型专攻旅行规划、婚礼筹备等无唯一标准答案、时间跨度长的复杂任务,可独立推进并交付结果。单任务可执行数千轮交互,持续 40-50 小时。

复杂推理与数学证明。继承 dots-note 3.0 在 IMO 2026 中六道题全部满分(42/42)的推理能力,具备形式化证明水平。

多模态统一理解。文本、图像、视频、音频经各自编码器处理后与语言模型对齐,支持视觉空间判读、文档图表解析与视频问答。

自主学习与纠错。模型在未知规则环境中通过观察提出假设并验证,出错时启动 Self-Critiquing 自我批判机制,将修正后的规则写入外部 memory.md 动态记忆文件,实现跨步骤的知识累积与策略调整。

端到端软件工程。可独立完成需求分析、技术选型、代码实现、编译构建到验证运行的完整开发流程。

5. 训练方法:TEMPO

dots 实验室提出 TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization),解决长程 Agent 训练中奖励稀疏与信用分配困难的问题。该方法将长程任务拆分为多个 macro-step,每个阶段结束时模型从 actor 切换为 critic,通过测试时扩展的推理和工具调用来估计当前状态的预期剩余回报,在任务结束前就更新策略。

据官方技术博客,TEMPO 训练的模型在 ARC-AGI-3 任务上的平均得分比 baseline checkpoint 提高 31.5%,比 GRPO 提高 20.6%。在引入 Self-Critiquing 机制后,模型的自我评价能力进一步增强——即使面对当前无法解决的问题,也能从两个表面相似的状态中识别出真正有突破希望的那个。

6. 硬件适配与部署

8 月 15 日,据华为中国官微消息,昇腾 Atlas 800 A3 与 Atlas 900 A3 SuperPoD 超节点已完成 dots3-note preview 的全功能适配,实现 Day-0 上线。适配基于 vLLM Ascend 推理引擎,包含 FlashComm 通信优化、FUSED_MC2 通算融合与 MTP 投机推理支持,用户可沿用 vLLM 标准接口零门槛迁移。

本地部署方面,27B 量化版本(GGUF)约 15-16 GB 显存,可在单卡运行;FP8 版本推荐单机 8 卡部署;BF16 全精度需要更多显存。

7. 系列背景

dots3 系列规划包含 note、jazz、aria 三档模型,分别面向不同能力、延迟与推理成本的平衡点。dots3-note preview 是 dots3 系列首个开放权重模型,也是 dots 实验室继 dots-note 3.0(IMO 2026 满分)后第二次面向开发者开放模型权重。

dots 部门为小红书于 2026 年 4 月 30 日宣布成立的 AI 一级部门,向公司总裁汇报,由原人文智能实验室 Hi Lab 升级而来。dots3-note 正式版官方表示将于近期开源,jazz 与 aria 两档后续推出。