- 上下文(输入 / 输出)
- 1.05M / 393K
- 参数量
- 552B / 激活 16B
- 发布时间
- 2026-09
- 许可协议
- MIT
- 输入模态
- 文本 · 图像
- 输出模态
- 文本
- 架构
- MoE, Causal Encoder-Decoder (CED)
- 模式
- 支持 non-thinking 与 thinking(low / high / max)
- 注意力
- Compressed Sparse Attention 2 (CSA2)
- 专家数量
- 384(每 token 6 个路由专家 + 1 个共享专家)
- 主干参数
- 552B
- 精确发布日期
- 2026-09-10
- 发布状态
- 正式 API 版本
- 权重状态
- 已开放(MIT)
- API 模型 ID
- deepseek-flash
- Engram 参数
- 196B(独立于主干参数)
- 输入激活参数
- 8B
- 输出激活参数
- 16B