研究
DeepSeek V4 Flash 0731 值不值得换——2026 年 8 月模型、成本与本地部署对比
截至 2026 年 8 月 1 日,公开证据没有生产冠军;低成本纯文本代码代理先用 deepseek-v4-flash 做同任务 POC 并记录 0731 后端指纹,多模态先测 Gemini 3.6 Flash,固定快照与零保留需求用 Claude Sonnet 5 对照;0731 的 MIT 权重已开放,本地方案从四卡节点和实测吞吐计算总成本,候选只在自有任务通过后灰度并保留原后端回滚。

文章导航
1 现在该怎么选:0731 先做低成本代码 POC,生产切换等自有结果
结论:DeepSeek V4 Flash 0731 是 2026 年 8 月低成本纯文本代码代理的首个 POC。请求使用 deepseek-v4-flash,默认开启 thinking、先用 high effort,响应同时记录 model、system_fingerprint、缓存命中、推理与输出 token、完成原因、延迟和重试。公开材料目前没有生产冠军;DeepSeek 的测试框架尚未发布,两套题集属于内部数据,各家模型也缺少同一工具、同一预算和同一任务快照的公开成绩。生产系统继续保留当前后端,只有自有仓库任务达到预先写明的成功率、修复量、时延与成本门槛时才逐步导流。
多模态工作从 Gemini 3.6 Flash 开始,因为它公开支持文本、图片、视频、音频和 PDF,并把搜索、代码执行、文件检索和函数调用放在同一托管表面。需要固定模型身份或符合条件的 Zero Data Retention 安排时,把 Claude Sonnet 5 作为生产对照。已有 GPT、Grok、GLM、Kimi、MiniMax 或 Qwen 工作流先留在原位;它们进入同一评测集,迁移由结果触发。
| 工作 | 首个 POC 或当前默认 | 固定对象 | 生产准入与退出 |
|---|---|---|---|
| 低成本纯文本代码代理 | deepseek-v4-flash,当前后端版本 0731 | 提示、工具 schema、任务提交、effort、最大轮次、超时;记录响应模型与 fingerprint | 自有任务通过率和修复量达到门槛后灰度;fingerprint 变化、失败率或 p95 超限就切回原后端 |
| 图片、音视频或 PDF 进入同一代理 | Gemini 3.6 Flash | 稳定模型 ID、媒体样本、工具权限、搜索和代码执行开关 | 多模态任务的字段提取、引用和工具副作用全部验收;任何模态退化时保留原路由 |
| 固定快照、合规数据处理或 ZDR 对照 | Claude Sonnet 5 | claude-sonnet-5 快照、组织数据设置、区域、日志与合同条件 | 供应商资格与自有评测同时通过;tokenizer 或合同变化后重新计量 |
| 数据必须留在自有边界或需要自定义 serving | 0731 官方 MIT 权重;小团队先用 Qwen3.6-35B-A3B 做单卡基线 | 权重提交、容器摘要、硬件拓扑、KV 配置、解析器、采样、路由与容量 | 相同任务质量通过且成功任务/节点小时覆盖总拥有成本;容量、可靠性或合规证据失效时回到托管 API |
这张表把“模型更强”拆成四份可采购的工作。0731 的单价和公开代理成绩让它取得低成本代码路线的首测资格;模态、固定身份、数据位置和运维责任会把其他路线送到不同候选。每条路线只有一个首测对象,候补在首测缺能力、触发退出条件或取得更好的同任务结果时进入。
1.1 可直接交给工程团队的 API、本地节点、验收与回滚单
托管 API 试点
- 入口
- 使用
https://api.deepseek.com的 Chat Completions 或 Responses API,请求模型写deepseek-v4-flash。thinking 默认开启,首轮使用reasoning_effort=high;只有已经允许长推理成本的任务进入max。 - 价格时点
- 截至本文截点,缓存命中输入、未命中输入和输出分别为每百万 token 0.0028、0.14 和 0.28 美元。价格页同时预告高峰时段将按当前价 2 倍计费,生效日期仍待公布;上线当天重新取价,把实际费率写入预算门槛,超限即撤回候选。
- 请求身份
- 固定系统提示、工具定义、温度、
top_p、最大输出、超时、最大轮次和任务提交。user_id使用无个人信息的内部伪名,既用于隔离也进入审计映射。 - 响应收据
- 保存返回的
model、system_fingerprint、finish reason、reasoning/output token、cache hit/miss、首 token 与总时延、工具参数校验、重试和最终测试结果。公开请求 ID 是可移动别名,fingerprint 负责暴露后端配置变化。 - 失败处理
length进入上下文或输出预算修正;content_filter进入人工或批准的替代路线;insufficient_system_resource只做有限次数退避重试,随后切回原后端。工具参数必须先通过本地 schema 和授权,再执行副作用。
0731 本地试点
- 固定制品
- 使用官方仓库提交
7872f01b…。SOSEC 读取该提交对应清单时,48 个 safetensors 共 166,886,535,336 字节,即 155.43 GiB;仓库页面按十进制显示约 167 GB。 - 起始拓扑
- 0731 官方模型卡给出单节点 4×GB300 的 vLLM 命令;该模型卡所链、当前明确以 0731 为默认的通用 V4 Flash recipe 还覆盖 H200、B200、B300 四卡 replica 与八卡 H200 的 4+4 prefill/decode 方案。采购前仍需在目标云和机型上确认互联、显存、驱动、内核和容器支持。
- 运行参数
- 启用 DeepSeek V4 tokenizer、reasoning parser、tool parser 和 DSpark 配置,agent 场景用官方建议的
temperature=1.0、top_p=0.95。high/max 的最大模型长度至少留到 384K;完整 1M 需要单独测 KV cache、并发和首 token 延迟。 - 供应链
- 权重、编码脚本、remote code、容器、vLLM/SGLang 和驱动都固定摘要。下载区只读,服务账户最小权限,模型入口与工具执行分网,升级先在隔离节点完成正负控制和回滚。
同任务验收
- 任务集
- 从真实仓库抽取缺陷修复、跨文件功能、测试补全、迁移、依赖升级和日志诊断,保存任务起点提交、允许工具、预期测试与禁止副作用。每个候选至少重复两次,避免一次采样决定采购。
- 结果
- 主指标是无需人工改写即可通过的任务;同时记录人工修复行、额外轮次、错误工具调用、未完成、拒绝、测试逃逸和回滚。代码行数、语气和模型自评不进入成功分母。
- SOSEC 起始门槛
- 候选在关键任务成功率上不得低于现有后端超过 2 个百分点,p95 完成时间不得恶化超过 20%,单个成功任务的完整费用至少下降 30%;这些是起始建议,正式数值由业务风险和容量校准。
- 本地附加项
- 记录可用 GPU 小时、成功任务/节点小时、队列、冷启动、权重重载、GPU/主机内存、KV 驱逐、网络、存储、功耗、值班和故障恢复。API 与本地都按成功任务结算。
灰度与撤回
- 路由
- 先镜像无副作用任务,再让小比例可回滚工作进入候选。路由键固定任务类型、仓库和用户组;同一任务重试时保留已用后端,避免把跨模型切换藏进一次结果。
- 自动撤回
- fingerprint 或本地制品摘要漂移、连续失败、工具 schema 错误、关键测试逃逸、费用或 p95 过线时,关闭候选路由并把新任务送回原后端。已执行的文件和外部动作按工作流补偿。
- 恢复证明
- 回滚后用一组固定正向任务和一组拒绝/越权工具负控制确认旧路由、日志、账单和权限都恢复。候选日志和失败制品保留到根因、费用和供应商工单关闭。
- 退出
- 两轮修正后仍无法达到关键成功率,或为了低单价引入无法承担的多租户、运维和许可责任时,终止该路线;下次版本只复用任务集与门槛,不继承旧结论。
2 三层身份已经对齐:API 别名、0731 后端与开放权重
DeepSeek 文档公开的请求 ID 是 deepseek-v4-flash。2026 年 8 月 1 日价格页把它映射到 DeepSeek-V4-Flash-0731,接口响应再返回实际 model 和代表后端配置的 system_fingerprint。采购、评测和事故记录需要同时保存这三项:请求别名说明调用入口,返回模型说明服务标识,fingerprint 捕捉同一名称下的后端变化。
0731 的开放权重在 API 公告之后同日进入 DeepSeek 官方 Hugging Face 组织和 V4 集合。模型卡明确称它为 Flash 正式版,取代 Preview,结构沿用 V4 Flash 并带 DSpark speculative decoding 模块;仓库采用 MIT 许可。SOSEC 在 2026-08-01 03:07:41 UTC 后固定提交 7872f01b1d1fe23eabc4c98b48bffcef5a386062。这使 API 与本地 POC 可以使用同名 0731 产品版本,服务端采样、编码、内核、量化、调度和工具封装仍会造成可测差异。
旧的 deepseek-ai/DeepSeek-V4-Flash 仓库继续保存 Preview 路线;DeepSeek-V4-Flash-DSpark 是 Preview 权重加推测解码模块。新的 0731 仓库包含重新后训练的正式权重和 DSpark。复现实验要写完整仓库和提交,单独写“V4 Flash”会把三件不同制品混在一起。
3 公开规格的有效比较:价格、模态、上下文和生命周期
下表只放进 2026 年 8 月 1 日仍有官方入口、可调用身份和公开价格的当前候选。每家选一个最接近“通用代理或代码工作”的代表,避免同一供应商占满表格。价格按官方每百万 token 口径原样保留;人民币价格不做临时汇率换算。参考任务固定为 20 万未缓存输入和 2 万输出,只展示费率如何落到账单,tokenizer、推理 token、重试、工具费和成功率由本地回放补齐。
| 模型与固定方式 | 公开模态与窗口 | 缓存 / 输入 / 输出单价 | 参考任务账单 | SOSEC 角色与缺口 |
|---|---|---|---|---|
DeepSeek V4 Flash 0731deepseek-v4-flash 是移动 API ID;记录返回版本与 fingerprint;本地固定提交 | 纯文本;1M 输入上下文;最大 384K 输出;thinking 默认开启;Chat、Responses、Anthropic 兼容和函数工具 | $0.0028 / $0.14 / $0.28 | $0.0336 | 低成本代码代理首测;公开 beta、移动别名、自有任务质量与稳定性待测 |
GPT-5.6 Terragpt-5.6-terra | 文本输出,文本和图片输入;1.05M / 128K;Responses、函数、结构化输出和多种托管工具 | $0.20 / $2 / $12;输入超过 272K 时整次请求输入 2×、输出 1.5× | $0.64 | 成熟工具面与视觉对照;长提示阶梯价、工具调用费和实际缓存写入需计入 |
Claude Sonnet 5claude-sonnet-5 按官方版本规则属于固定快照 | 文本和图片输入、文本输出;1M / 128K;adaptive thinking 与工具;符合条件的 ZDR 安排 | 8 月 31 日前入门价 $2 / $10;标准 $3 / $15;缓存按 Anthropic 独立规则 | $0.60 入门价;$0.90 标准 | 固定身份和数据治理对照;新 tokenizer 会改变旧工作负载 token 数 |
Gemini 3.6 Flashgemini-3.6-flash 稳定版 | 文本、图片、视频、音频、PDF 输入;1,048,576 / 65,536;搜索、Maps、代码执行、文件检索和函数工具 | $0.15 / $1.50 / $7.50;缓存存储另计 | $0.45 | 多模态与托管工具首测;grounding、工具和存储费用需随任务计量 |
GLM 5.2glm-5.2 | 纯文本;1M / 128K;thinking、函数、结构化输出、缓存和 MCP;MIT 权重 | $0.26 / $1.40 / $4.40 | $0.368 | 托管与开放权重双路线对照;本地完整模型需要八卡级资源 |
Kimi K3kimi-k3 | 原生多模态;1M;always-thinking;OpenAI 与 Anthropic 兼容;开放权重 | $0.30 / $3 / $15 | $0.90 | 超大开放多模态代理对照;本地最低拓扑、许可证和工具解析成本很高 |
| Grok 4.5 生产比较固定日期 ID,裸名和 -latest 会移动 | 厂商当前代码和通用推荐;500K;可调 reasoning;工具能力按 xAI 文档 | 短上下文 $0.30 / $2 / $6;长上下文 $0.60 / $4 / $12 | $0.52–$1.04 | Pricing 表把长上下文写成 ≥200K,模型详情页写成超过 200K;本例恰为 200K,实账关闭边界冲突 |
MiniMax M3MiniMax-M3;价格页先于部分 API 指南更新 | 原生多模态;1M 权重模型;托管长上下文分档;开放权重采用社区许可证 | ≤512K 当前价 $0.06 / $0.30 / $1.20;512K–1M 为 $0.12 / $0.60 / $2.40 | $0.084 | 低价多模态候选;价格页与 API 指南同步、长上下文供应和商业授权边界先闭合 |
Qwen3.7 Maxqwen3.7-max-2026-06-08 固定快照 | 文本、图片和视频输入,文本输出;1M;thinking/non-thinking、函数、内置工具和结构化输出 | 标准价表未单列缓存 / CNY 12 / CNY 36;0<输入≤1M 同档,区域价格不同 | CNY 3.12 | 阿里云固定快照对照;选择区域、币种和具体 snapshot 后再算账 |
表中最醒目的数字是 DeepSeek 的价格,同时也最容易让采购跳过试验。一个成功任务会消耗几次模型调用、工具回传和修复循环;失败任务同样产生账单。模态也会改变输入计量,托管搜索、文件检索、代码执行和计算机操作可能按调用收费。真正可比较的单位是“一个达到验收标准的任务所需总费用”,它把 token、工具、重试和人工修正放到同一分母。
生命周期决定结果能否复现。DeepSeek 的公开 API 只接受移动别名,因而需要 response identity;Anthropic 明确说明 Sonnet 5 的无日期 ID 是固定快照;Google 把 3.6 Flash 标为稳定;xAI 的裸名和 -latest 会移动;Qwen 同时给出移动别名和日期快照。模型路由器要把这些差异变成策略:固定评测使用可固定 ID,本地权重使用提交,移动入口保存返回身份并在变化时自动重跑回归。
4 DeepSeek 的发布分数把 0731 送进首测,生产排名仍缺同口径证据
DeepSeek 为 0731 公布了九项代理结果:Terminal Bench 2.1 为 82.7,NL2Repo 54.2,Cybergym 76.7,DeepSWE 54.4,Toolathlon-Verified 70.3,Agents’ Last Exam 25.2,AutomationBench Public 25.1,DSBench-FullStack 68.7,DSBench-Hard 59.6。相对同一发布表中的 Preview,所有项目都有明显提高,尤其 DeepSWE 从 7.3 上升到 54.4。这组数据足以解释首测顺序。
证据边界也由模型卡写得很清楚。公开代码代理题使用 DeepSeek Harness 的 minimal 模式,框架标注为“to be released”,运行 max effort、temperature=1.0、top_p=0.95;DSBench-FullStack 和 DSBench-Hard 属于内部题集。发布表中的 GLM 与 Opus 分数来自厂商收集的比较,当前页面没有交付所有模型的同一容器、工具定义、任务快照、最大轮次、失败重跑和完整日志。
跨厂商总榜会把这些差异压成一列小数。真实代码代理的结果由模型、harness、shell 权限、测试、上下文构建、重试和终止条件共同产生。SOSEC 因此保留发布者分数原有用途:它负责选择进入评测的候选;生产排序只读取自有同任务回放。若 DeepSeek 随后发布固定 Harness 和日志,新增证据可以提高可复核性,旧结果仍要保持其当时版本和设置。
4.1 一套小而硬的评测集比一千道泛化题更接近采购决定
任务集先按业务失败方式分层。仓库内小修复检查定位和测试纪律;跨文件功能检查规划、上下文和工具循环;迁移与依赖升级检查文档、兼容与回滚;日志诊断检查证据使用;安全任务检查模型是否越过权限或绕开失败测试。每类都保留已知可通过的正控制、必须拒绝的负控制和一个资源故障路径。
评分器只接受可运行结果。候选在隔离 worktree 中修改文件,项目原生测试、静态检查和任务专属断言决定成功;人工评审再看权限、范围、可维护性和隐藏副作用。模型输出“已完成”、生成更多代码或通过自写的宽松测试都不会增加分数。任务失败后记录最早偏离点:上下文遗漏、错误计划、工具参数、测试逃逸、资源终止、拒绝或修复循环。
每个模型至少运行两次同一任务,顺序轮换,避免缓存、服务负载和仓库热状态固定偏向一个候选。评测保存完整用量和费用,失败调用单列;成功任务成本、人工分钟和 p95 只按通过验收的任务计算。这样才能回答用户真正关心的问题:给定团队和仓库,0731 是否比现有后端更快、更便宜地交付可合并结果。
5 从每百万 token 到总成本:低价 API 让本地节点面对很高的利用率门槛
先把费率换成一张人能读懂的账单。本文参考任务使用 20 万未缓存输入和 2 万输出;DeepSeek 0731 的账单为 0.2×0.14 + 0.02×0.28 = 0.0336 美元。同一 token 数下,MiniMax M3 的 ≤512K 当前价为 0.084 美元,GLM 5.2 为 0.368 美元,Gemini 3.6 Flash 为 0.45 美元,Claude Sonnet 5 入门价为 0.60 美元,GPT-5.6 Terra 为 0.64 美元,Kimi K3 与 Claude 标准价均为 0.90 美元;Grok 4.5 因官方两页在 200K 边界的写法冲突,账单落在 0.52–1.04 美元。Qwen 的全球档为 3.12 元人民币。
Grok 的区间来自可定位的文档差异:模型详情说输入超过 200K 才进入长上下文价,Pricing 表写成 ≥200K,并把输入、缓存和输出同时翻倍。本文的输入恰为 200K,无法靠文字解释消除边界;POC 保存实际 usage 与账单,把供应商计费结果写进采购记录。其余八个候选在 200K 输入处都能确定档位:Terra 尚未越过 272K,Sonnet 5 与 Gemini 3.6 Flash 覆盖整窗统一价,MiniMax 位于 ≤512K 档,Qwen 快照覆盖 0<输入≤1M,DeepSeek、GLM 与 Kimi 当前页面没有另列 200K 阶梯。
这项算术故意保持窄。各模型 tokenizer 不同,20 万相同字符会产生不同 token;reasoning token、图片、音视频、搜索和工具可能改变计量;一次代码任务常有多个调用。缓存也会重写结论:DeepSeek 的命中输入单价只有每百万 0.0028 美元,稳定前缀越大,API 越便宜。评测器因此同时保存原始字节、供应商 token、cache hit/miss 和工具账单,不把示例价格当作实测成本。
本地端的公式是:每个成功任务成本 =(GPU + CPU/内存 + 存储 + 网络 + 电力/机房 + 平台 + 运维 + 冗余的每小时成本)÷ 每节点小时成功任务数。显卡利用率只能说明设备忙,成功任务数才能说明设备交付。队列等待、长上下文 KV cache、失败重试、权重更新、节点故障和低谷空闲都会进入分子或压低分母。
Runpod 2026 年 7 月 27 日更新的公开 Pod 价格给出 H200 每卡小时 4.39 美元、B200 为 5.89 美元、B300 为 7.39 美元。按四卡和每月 730 小时计算,裸 GPU 租金分别是 12,818.80、17,198.80 和 21,578.80 美元。它们没有包含 CPU、内存、存储、网络、镜像下载、值班和冗余,具体 Pod 也要确认四卡是否位于满足互联要求的同一节点;B300 价格不能代替 GB300 报价。
用 0.0336 美元的 DeepSeek 参考任务账单除回去,4×H200 必须完成约 523 个成功参考任务/节点小时,4×B200 约 701 个,4×B300 约 880 个,才触及裸租金线。这个数是所需容量阈值,实际吞吐要在目标上下文、effort、输出、并发和质量门槛下测量。加入双节点冗余、人员和空闲后,盈亏平衡点继续上移;API 缓存命中也会把它推远。
月度场景更直观。每天 100 个参考任务的 DeepSeek API 账单约 100.80 美元;每天 1,000 个约 1,008 美元;每天 10,000 个约 10,080 美元。四卡 H200 的裸租金已经接近第三档,却仍需证明节点每天能稳定交付 10,000 个合格任务,并承担峰值、故障与升级。数据驻留、出网限制、定制 serving 或可预测保留容量可以单独为本地部署创造价值,这份非价格收益应写入采购理由和退出条件。
6 本地部署已经可行:0731 从四卡级正式起步,单卡先做控制基线
0731 权重开放后,本地路线终于可以和 API 使用同一产品版本。155.43 GiB 只描述仓库中的权重文件;服务还要容纳运行时、通信缓冲、DSpark、KV cache、批次和上下文。完整 1M 与 384K high/max 输出对显存和时延的影响必须独立测量。官方四卡 GB300 示例给出可运行起点,采购清单仍需按目标并发和序列长度计算。
| 本地候选 | 固定权重与许可 | 公开制品规模 | 官方或框架部署起点 | 实际角色与公开成本边界 |
|---|---|---|---|---|
| DeepSeek V4 Flash 0731 | 7872f01b…;MIT;正式 0731 + DSpark | SOSEC 清单求和 155.43 GiB 权重;HF 显示约 167 GB | 模型卡 4×GB300;当前以 0731 为默认的 vLLM V4 Flash recipe 给出 H200/B200/B300 四卡 replica 和 8×H200 的 4+4 PD;high/max 至少 384K | 精确模型本地首测;4×H200 裸租约 $17.56/小时,节点拓扑和完整 TCO 需报价与实测 |
| Qwen3.6-35B-A3B FP8 | 官方 FP8;Apache-2.0;35B 总量/3B 激活 | 固定清单约 34.89 GiB;262K 原生上下文,可用 YaRN 扩展 | vLLM 提供单 H100/H200 或 MI300X 级路线;NVFP4 可进入 RTX Pro 6000 / DGX Spark 路线 | 小中团队的单卡 serving、工具和观测基线;它不代表 0731 质量,1×H200 裸租约 $3,204.70/月 |
| GLM 5.2 | 官方权重;MIT | 固定 BF16 清单约 1,403.19 GiB | FP8 实用默认为 8×H200/H20;完整 1M 参考路线使用 8×B200 与 FP8 KV cache | 更重的开放代码/代理对照;8×H200 裸租约 $25,637.60/月,量化质量与吞吐待测 |
| MiniMax M3 | MiniMax Community License;商业署名和收入授权边界需法务确认 | 捕获的官方仓库清单约 854 GB BF16;模型卡确认 427/428B 总量、23B 激活 | 原生多模态;硬件和长上下文配置按当前官方 serving 文档与供应商报价验证 | 需要本地多模态时进入采购评估;许可、API 文档同步和节点费用先闭合 |
| Kimi K3 | 官方权重;Kimi K3 License;2.8T 总量/104B 激活 | 固定清单约 1,453.74 GiB | vLLM recipe 至少 8×GB300;真实生产进入多节点、网络和工具解析治理 | 超大原生多模态本地对照;GB300 与多节点成本需要正式报价 |
6.1 四卡机器之外,还要建设一项内部模型服务
下载阶段先解决 167 GB 级对象的来源、断点、校验和镜像。权重与代码进入只读制品库,生产节点从内部镜像拉取;每次发布绑定 Hugging Face 提交、单文件摘要、编码目录、容器和驱动。DeepSeek 模型卡没有 Jinja chat template,提供专用 encoding 脚本;vLLM 的 DeepSeek V4 tokenizer、reasoning parser 和 tool parser 要与固定版本一起验收。解析器漂移可能让相同权重产生不同工具行为。
服务层要定义租户隔离、排队、公平性、限流、超时、取消、流式中断和资源不足的错误合同。长上下文会占用 KV cache,单个巨型请求可能拖慢短请求;调度器需要按上下文和 effort 分池,限制每租户在途 token,并暴露 queue、prefill、decode、KV 驱逐和失败指标。完整一百万上下文只在真实任务获得增益后开放,默认窗口按观测到的有效输入分布配置。
工具执行继续由应用控制。模型服务只生成经过解析的调用意图,策略层核对主体、工具、参数、仓库、路径和副作用额度,执行器运行在独立沙箱,返回结果带大小与敏感字段限制。多租户场景还要验证 prompt/cache 隔离、日志脱敏、制品访问和管理接口认证。本地部署把数据路径收回组织,也把这些责任交给组织。
高可用需要第二份容量或一个托管回退。单节点维护、驱动故障、权重重载和 GPU 错误会让整条路线停机;两套满配节点会直接翻倍大部分固定成本。团队可以选择一主一小型降级池、跨可用区双节点,或本地优先加 DeepSeek API 回退。每种选择都明确数据能否出边界、降级支持哪些任务、缓存是否兼容,以及回到本地前如何确认权重和日志连续。
6.2 买机器、租节点和继续用 API,对应三种不同承诺
API 适合需求波动、任务量尚小和模型仍在快速换代的团队。它把 GPU、内核和可用性运营交给供应商,调用方保留评测、数据治理、工具权限和回滚责任。DeepSeek 当前单价让这条路线覆盖很大的任务量区间;移动别名和公开 beta 状态则要求更严的响应身份记录和回归。
按小时租四卡节点适合数据位置、短期容量实验和 serving 定制。采购方能固定权重与容器,也能随时释放节点;持续下载、空闲和跨区存储会产生额外账单。合同前确认同机互联、共享存储、镜像时间、配额和故障替换,公开的“每卡小时”只有在拓扑满足时才形成可用节点。
自购设备适合稳定高利用率、机房与 GPU 运维已经成熟的组织。总拥有成本包含设备折旧、资金、保修、机架、供电、冷却、交换、备件、人员和利用率机会成本。三年摊销不能掩盖模型六个月后换代的风险;退出路径要允许节点承接其他推理任务,并保留托管 API 兼容层。采购判断最终由成功任务吞吐、政策价值和可复用基础设施共同决定。
7 收口:把 0731 当成一个可撤回的产品变化
对绝大多数团队,最合适的下一步很简单:继续保留现有生产模型,用 DeepSeek 托管 API 跑同一批真实代码任务。它的 0.0336 美元参考账单足够低,能在购买四卡节点以前快速得到质量、工具、延迟和失败证据。多模态任务让 Gemini 3.6 Flash 同场,固定身份或 ZDR 要求让 Claude Sonnet 5 同场;其余模型只在当前工作负载或采购边界需要时加入。
0731 权重的开放改变了数据边界和定制空间,公开提交、MIT 许可和 serving 文档让本地 POC 具备可执行入口。四卡级硬件、155.43 GiB 权重、KV cache、DSpark、解析器和模型服务运营共同构成真实方案。每天几百或几千个长任务仍通常由 API 获得更低的直接成本;高稳定吞吐、数据驻留或已有 GPU 平台可以把本地方案推入首测。
最终的生产答案写在一张版本化决策记录里:任务集提交、候选身份、成功率、人工修复、p50/p95、完整费用、工具副作用、数据路径、容量、故障恢复和回滚结果。0731 达标就灰度,任何关键门槛失守就撤回。下一个模型发布时重复同一合同,团队由此沉淀持续选择模型的能力;静态排行榜会随别名和后端更新迅速过期。
研究记录
8证据、对象与来源
下面保留本文实际使用的标识、时间和原始材料,便于继续调查。
8.1研究对象
报告涉及的产品、行为者、技术、受影响对象和控制点。
2026-08-01 价格页映射到 DeepSeek-V4-Flash-0731 的移动请求标识
SOSEC 固定并读取 blobs 清单的官方 Hugging Face 提交
48 个 safetensors 的清单求和,等于 155.43 GiB
用于解释公开费率的账单算术,不代表跨 tokenizer 的质量或吞吐结果
8.2事件时间
- DeepSeek V4 Preview 权重发布
V4 Flash Preview 建立 284B/13B、1M 上下文和 MIT 权重路线,后续 0731 在相同架构上重新后训练。
- V4 Flash 0731 API 进入公开 beta
DeepSeek 更新移动 API 别名、代理成绩、Responses API 与极低价格,公告说明 Harness 和内部题集边界。
- 0731 官方权重进入 Hugging Face
官方仓库和 V4 集合加入 0731;SOSEC 随后固定提交并核算权重字节。
- SOSEC 完成公开信息与成本截面
API 费率、模型身份、本地部署拓扑、公开 GPU 租价和对照模型入口在同一截面复核。
8.3来源与材料
- DeepSeek API 更新公告https://api-docs.deepseek.com/updates/
- DeepSeek 模型、功能、价格与并发https://api-docs.deepseek.com/quick_start/pricing/
- DeepSeek Chat Completions 参数、结束原因、用量与 fingerprinthttps://api-docs.deepseek.com/api/create-chat-completion
- DeepSeek 速率限制与用户隔离https://api-docs.deepseek.com/quick_start/rate_limit
- DeepSeek V4 Flash 0731 官方模型卡、测试、部署与 MIT 许可https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
- 固定 0731 官方权重提交https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/tree/7872f01b1d1fe23eabc4c98b48bffcef5a386062
- DeepSeek V4 官方模型集合https://huggingface.co/collections/deepseek-ai/deepseek-v4
- vLLM V4 Flash 通用部署 recipe(0731 为当前默认)https://recipes.vllm.ai/deepseek-ai/DeepSeek-V4-Flash
- SGLang DeepSeek V4 部署与调优 cookbookhttps://docs.sglang.io/cookbook/autoregressive/DeepSeek/DeepSeek-V4
- OpenAI GPT-5.6 Terra 官方模型页https://developers.openai.com/api/docs/models/gpt-5.6-terra
- Anthropic Claude 当前模型、价格与上下文https://platform.claude.com/docs/en/about-claude/models/overview
- Anthropic 模型 ID 与版本规则https://platform.claude.com/docs/en/about-claude/models/model-ids-and-versions
- Anthropic 完整计价与 Sonnet 5 全上下文统一费率https://platform.claude.com/docs/en/about-claude/pricing
- Anthropic Sonnet 5 tokenizer、上下文与 ZDR 说明https://platform.claude.com/docs/en/about-claude/models/whats-new-sonnet-5
- Anthropic API 数据保留与 ZDR 资格边界https://platform.claude.com/docs/en/manage-claude/api-and-data-retention
- Google Gemini 3.6 Flash 官方模型页https://ai.google.dev/gemini-api/docs/models/gemini-3.6-flash
- Google Gemini API 官方价格https://ai.google.dev/gemini-api/docs/pricing
- Z.ai GLM 5.2 模型与接口https://docs.z.ai/guides/llm/glm-5.2
- Z.ai 官方模型价格https://docs.z.ai/guides/overview/pricing
- GLM 5.2 官方开放权重https://huggingface.co/zai-org/GLM-5.2
- vLLM GLM 5.2 部署 recipehttps://recipes.vllm.ai/zai-org/GLM-5.2
- Kimi API 模型与价格https://platform.kimi.ai/
- Kimi K3 官方模型卡与许可证https://huggingface.co/moonshotai/Kimi-K3
- vLLM Kimi K3 部署 recipehttps://recipes.vllm.ai/moonshotai/Kimi-K3
- Alibaba Cloud Model Studio 文本模型列表与快照https://help.aliyun.com/en/model-studio/text-generation-model
- Alibaba Cloud Qwen3.7 Max 快照与视觉能力发布记录https://help.aliyun.com/en/model-studio/newly-released-models
- Alibaba Cloud Model Studio 官方价格https://help.aliyun.com/en/model-studio/model-pricing
- xAI 当前模型、身份与价格https://docs.x.ai/developers/models
- xAI Grok 4.5 模型详情与 200K 边界说明https://docs.x.ai/developers/models/grok-4.5
- xAI 全模型价格与 ≥200K 长上下文表https://docs.x.ai/developers/pricing
- MiniMax 当前 API 价格https://platform.minimax.io/subscribe/token-plan?tab=api-enterprise
- MiniMax M3 官方权重与许可证https://huggingface.co/MiniMaxAI/MiniMax-M3
- MiniMax M3 社区许可证全文https://huggingface.co/MiniMaxAI/MiniMax-M3/blob/main/LICENSE
- Qwen3.6-35B-A3B 官方模型卡https://huggingface.co/Qwen/Qwen3.6-35B-A3B
- Qwen3.6-35B-A3B 官方 FP8 权重https://huggingface.co/Qwen/Qwen3.6-35B-A3B-FP8
- vLLM Qwen3.6-35B-A3B 单卡部署 recipehttps://recipes.vllm.ai/Qwen/Qwen3.6-35B-A3B
- Runpod GPU Pod 公开价格https://www.runpod.io/pricing