DeepSeek-V3 671B
DEEPSEEK:V3-671B大语言模型极速响应负载:68%SLA:99.99%无排队 · 直连
671B MoE (37B Activated) + Multi-Head Latent Attention
标准调用费率
2 算力点/1K Tokens
24h +38.90%
全球现象级开源超级混合专家大模型,在代码、数学、多语种理解与创意思维上比肩顶尖闭源模型,极高性价比。
24小时实时调用
1248.1万次
+38.90% 较昨日
累计模态交付产出
0.10亿Tokens
+36.5% · 代码推理 89%
平均响应时延 (端到端)
185ms
首字(TTFT) 110ms · 142 tok/s
高可用 SLA 与节点自愈
99.99%
自愈漂移 <45ms
模型算力与调用深度走势
DEEPSEEK:V3-671BInvocations
546,026次+30.27%
实时遥测
性能指标与并发吞吐
生产级 SLA 与长尾时延监控
首字/首块延迟 (P50 TTFT)110 ms
长尾极端延迟 (P99 Latency)380 ms
平均并发吞吐能力
全网并发负载峰值4,850 req
全球专线丢包率0.0005%
计费模型与成本结构
阶梯计费与高并发折扣明细
单次任务基准消耗2 算力点
提示词输入成本 (每千字)¥0.001
生成产出计费 (每千字)¥0.002
超分辨率 4K 倍率1.0x
会员专属峰值折扣至高 40% 优惠
架构设计与技术规格
参数规模与原生分辨率上限
核心架构671B MoE (37B Activated) + Multi-Head Latent Attention
有效参数量671 Billion Total
上下文窗口长度128,000 tokens
最大输出分辨率N/A
最大单次时长/尺寸N/A
全球专线节点与健康拨测
实时各区网络 Ping 与负载均衡
华东节点 (上海)
12ms
华南节点 (广州)
16ms
香港专线 (Hong Kong)
28ms
亚太核心 (新加坡)
48ms
美西中心 (硅谷)
135ms
欧洲法兰克福 (EU)
154ms
