2026 年 8 月 19 日——小红书 dots 实验室于 8 月 14 日开源 dots3 系列首个开放权重模型 dots3-note preview,并于 8 月 19 日通过 Dots API 开放平台(dots.ai/platform)上线官方 API 调用服务。官方 API 目前限时免费开放,用户注册账号即可获取 API Key 直接调用,无需本地部署。
该模型采用 280B 总参数、16B 激活参数的 MoE 架构,支持 512K 超长上下文与文本、视觉、语音、视频四模态理解,是 dots3 系列(规划包含 note、jazz、aria 三档)中最轻量的版本,主打长程开放域 Agent 任务,继承同系列 dots-note 3.0 在 IMO 2026 国际数学奥林匹克竞赛中获官方认证满分(42/42)的推理基因。模型权重采用 Apache 2.0 协议,在 Hugging Face 与 GitHub 开放下载,华为昇腾 Atlas 800 A3 与 Atlas 900 A3 SuperPoD 已于 8 月 15 日完成全功能适配。
1. API 限时免费
据 dots 实验室官方发布,Dots API 开放平台于 8 月 19 日上线。用户通过小红书账号登录 dots.ai/platform 后,可在 API Keys 栏目创建密钥,直接通过云端接口调用 dots3-note preview 模型。官方 API 目前处于限时免费阶段,开发者可在免费额度内直接调用,无需预先充值或订阅付费套餐。
作为对比,第三方托管平台 DeepInfra 同日上线了 dots3-note preview 的商业托管 API,定价为输入 $2/百万 token、输出 $6/百万 token、缓存命中 $0.20/百万 token。官方 API 的限时免费政策为开发者提供了零成本试用窗口。
限时免费截止时间:截至发稿,官方尚未公布限时免费的具体截止日期,建议关注 Dots API 开放平台官方公告。
2. 开源详情
dots3-note preview 于 8 月 14 日在以下平台同步开放权重,采用 Apache 2.0 许可证:
| 平台 | 地址 |
|---|---|
| Hugging Face | dots-studio/dots3-note-prev(BF16) |
| Hugging Face | dots-studio/dots3-note-prev-fp8(FP8 量化) |
| GitHub | studio-dots-ai/dots3-note-prev |
| ModelScope | dots3-note preview |
官方推荐 FP8 版本在单机 8 卡(如 8×H100)上以 TP=8、EP=8 部署;BF16 版本需要更多显存。模型支持 vLLM、SGLang 与 Transformers 三种推理框架,SGLang 官方提供 lmsysorg/sglang:dev-dots3-note 镜像与 cookbook 配方。
3. 模型规格
| 项目 | 数据 |
|---|---|
| 模型名称 | dots3-note preview |
| 总参数 | 280B |
| 激活参数 | 16B |
| 架构 | MoE(256 个路由专家 + 1 个共享专家,Top-8 路由) |
| 隐藏层维度 | 5,120 |
| 词表大小 | 152K |
| 原生上下文 | 512K Token |
| 注意力机制 | MLA 底座 + SWA 与 DSA 混合稀疏注意力 |
| 输入模态 | 文本、图像、视频、音频 |
| 视觉编码器 | 7B 总参数 / 1.2B 激活的 MoE ViT |
| 音频编码器 | 800M 参数稠密网络 |
| 多 Token 预测 | 1.13B 参数共享 MTP 层,并行预测最多 3 个后续 token |
| 开源协议 | Apache 2.0 |
| 官方 API | 限时免费(dots.ai/platform,8 月 19 日上线) |
| DeepInfra 托管 API | 输入 $2 / 输出 $6 / 缓存 $0.20(每百万 token) |
4. 核心能力
据官方模型卡与发布信息,dots3-note preview 在以下方向做了针对性优化:
长程开放域 Agent。区别于数学、代码等标准化场景,模型专攻旅行规划、婚礼筹备等无唯一标准答案、时间跨度长的复杂任务,可独立推进并交付结果。单任务可执行数千轮交互,持续 40-50 小时。
复杂推理与数学证明。继承 dots-note 3.0 在 IMO 2026 中六道题全部满分(42/42)的推理能力,具备形式化证明水平。
多模态统一理解。文本、图像、视频、音频经各自编码器处理后与语言模型对齐,支持视觉空间判读、文档图表解析与视频问答。
自主学习与纠错。模型在未知规则环境中通过观察提出假设并验证,出错时启动 Self-Critiquing 自我批判机制,将修正后的规则写入外部 memory.md 动态记忆文件,实现跨步骤的知识累积与策略调整。
端到端软件工程。可独立完成需求分析、技术选型、代码实现、编译构建到验证运行的完整开发流程。
5. 训练方法:TEMPO
dots 实验室提出 TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization),解决长程 Agent 训练中奖励稀疏与信用分配困难的问题。该方法将长程任务拆分为多个 macro-step,每个阶段结束时模型从 actor 切换为 critic,通过测试时扩展的推理和工具调用来估计当前状态的预期剩余回报,在任务结束前就更新策略。
据官方技术博客,TEMPO 训练的模型在 ARC-AGI-3 任务上的平均得分比 baseline checkpoint 提高 31.5%,比 GRPO 提高 20.6%。在引入 Self-Critiquing 机制后,模型的自我评价能力进一步增强——即使面对当前无法解决的问题,也能从两个表面相似的状态中识别出真正有突破希望的那个。
6. 硬件适配与部署
8 月 15 日,据华为中国官微消息,昇腾 Atlas 800 A3 与 Atlas 900 A3 SuperPoD 超节点已完成 dots3-note preview 的全功能适配,实现 Day-0 上线。适配基于 vLLM Ascend 推理引擎,包含 FlashComm 通信优化、FUSED_MC2 通算融合与 MTP 投机推理支持,用户可沿用 vLLM 标准接口零门槛迁移。
本地部署方面,27B 量化版本(GGUF)约 15-16 GB 显存,可在单卡运行;FP8 版本推荐单机 8 卡部署;BF16 全精度需要更多显存。
7. 系列背景
dots3 系列规划包含 note、jazz、aria 三档模型,分别面向不同能力、延迟与推理成本的平衡点。dots3-note preview 是 dots3 系列首个开放权重模型,也是 dots 实验室继 dots-note 3.0(IMO 2026 满分)后第二次面向开发者开放模型权重。
dots 部门为小红书于 2026 年 4 月 30 日宣布成立的 AI 一级部门,向公司总裁汇报,由原人文智能实验室 Hi Lab 升级而来。dots3-note 正式版官方表示将于近期开源,jazz 与 aria 两档后续推出。
举手提问