研究
DeepSeek V4 Flash 0731 值不值得换——2026 年 8 月模型、成本与本地部署对比
截至 2026 年 8 月 1 日,公开证据没有生产冠军;低成本纯文本代码代理先用 deepseek-v4-flash 做同任务 POC 并记录 0731 后端指纹,多模态先测 Gemini 3.6 Flash,固定快照与零保留需求用 Claude Sonnet 5 对照;0731 的 MIT 权重已开放,本地方案从四卡节点和实测吞吐计算总成本,候选只在自有任务通过后灰度并保留原后端回滚。

文章导航
1 先给答案:低价代码任务先试 0731,生产流量继续留在原后端
结论:DeepSeek V4 Flash 0731 是 2026 年 8 月最值得先跑的低成本纯文本代码候选。请求使用 deepseek-v4-flash,thinking 保持开启,首轮从 high effort 开始;生产系统继续使用现有后端,等一组真实仓库任务同时交出质量、时延、工具可靠性和成功任务成本,再决定是否导流。公开材料能确定首测顺序,当前还无法给出跨厂商生产冠军。
任务里有图片、音视频或 PDF 时,先测 Gemini 3.6 Flash;它把这些输入与搜索、代码执行、文件检索和函数调用放在同一托管接口。固定模型身份或符合条件的 Zero Data Retention 安排是硬要求时,用 Claude Sonnet 5 做对照。数据必须留在自有边界时,0731 的 MIT 权重已经提供可执行入口,本地路线从四卡节点起算,单卡小模型只负责验证 serving、工具和观测合同。
GPT、Grok、GLM、Kimi、MiniMax 和 Qwen 仍有各自适用的能力、价格与部署边界。它们会进入同一批任务,最终去留由任务结果决定。一个团队真正要选的是哪条路线能稳定完成自己的工作,以及失败时能否立刻退回已知可用的后端。
2 用三十个真实任务,把低单价变成一个可以撤回的生产决定
第一轮只做对照,不换生产。从真实仓库抽取约三十个任务,覆盖缺陷修复、跨文件功能、测试补全、迁移、依赖升级和日志诊断。每个任务固定起点提交、系统提示、工具 schema、允许权限、最大轮次、超时、预期测试和禁止副作用;现有后端与 0731 各跑至少两次,顺序交替。多模态或数据治理需求明确时,再把 Gemini 3.6 Flash 或 Claude Sonnet 5 放进同一任务合同。
API 请求和响应一起留收据。入口使用 https://api.deepseek.com 的 Chat Completions 或 Responses API,模型写 deepseek-v4-flash。截点时缓存命中输入、未命中输入和输出分别为每百万 token 0.0028、0.14 和 0.28 美元;价格页还预告未来高峰时段按当前价 2 倍计费,生效日期尚未公布,因此灰度当天必须重新取价。每次保存返回的 model、system_fingerprint、finish reason、reasoning/output token、cache hit/miss、首 token 和总时延、工具参数校验、重试与最终测试。length 进入上下文或输出预算修正,content_filter 进入人工或批准的替代路线,insufficient_system_resource 只做有限退避,随后切回原后端;任何有副作用的工具调用都先过本地 schema 与授权。
准入只看可运行结果。主指标是无需人工改写即可通过验收的任务,同时统计人工修复行、额外轮次、错误工具调用、未完成、拒绝、测试逃逸和回滚。关键任务要求候选的成功率置信下界不低于现有后端,越权工具调用与关键测试逃逸保持零容忍,p95 留在当前服务目标内;单个成功任务节省的完整费用还要覆盖迁移、观测和额外值班。基线、样本量、置信区间和业务零容忍项先写进评测记录,再由数据决定是否灰度。
本地试点固定到字节和拓扑。使用官方提交 7872f01b…;48 个 safetensors 合计 166,886,535,336 字节,即 155.43 GiB。官方模型卡给出单节点 4×GB300 的 vLLM 起点,关联 recipe 还覆盖 H200、B200、B300 四卡 replica 和八卡 H200 的 4+4 prefill/decode。权重、编码脚本、remote code、容器、vLLM 或 SGLang、驱动和解析器全部固定摘要,目标云上的互联、显存、内核、KV cache、并发和首 token 延迟另行实测。
灰度从无副作用任务开始。先镜像,再把小比例可回滚工作送给候选。fingerprint 或本地制品摘要漂移、连续失败、工具 schema 错误、关键测试逃逸、费用或 p95 越线时,候选路由立即关闭,新任务回到原后端。回滚后运行固定正向任务和拒绝/越权工具负控制,确认路由、日志、账单和权限恢复;两轮修正仍达不到关键成功率,或本地路线的多租户、运维和许可责任超出团队能力时,结束本轮试点。
3 三层身份已经对齐:API 别名、0731 后端与开放权重
DeepSeek 文档公开的请求 ID 是 deepseek-v4-flash。2026 年 8 月 1 日价格页把它映射到 DeepSeek-V4-Flash-0731,接口响应再返回实际 model 和代表后端配置的 system_fingerprint。采购、评测和事故记录需要同时保存这三项:请求别名说明调用入口,返回模型说明服务标识,fingerprint 捕捉同一名称下的后端变化。
0731 的开放权重在 API 公告之后同日进入 DeepSeek 官方 Hugging Face 组织和 V4 集合。模型卡明确称它为 Flash 正式版,取代 Preview,结构沿用 V4 Flash 并带 DSpark speculative decoding 模块;仓库采用 MIT 许可。本文在仓库 2026-08-01 03:07:41 UTC 更新后固定提交 7872f01b1d1fe23eabc4c98b48bffcef5a386062。这使 API 与本地 POC 可以使用同名 0731 产品版本,服务端采样、编码、内核、量化、调度和工具封装仍会造成可测差异。
旧的 deepseek-ai/DeepSeek-V4-Flash 仓库继续保存 Preview 路线;DeepSeek-V4-Flash-DSpark 是 Preview 权重加推测解码模块。新的 0731 仓库包含重新后训练的正式权重和 DSpark。复现实验要写完整仓库和提交,单独写“V4 Flash”会把三件不同制品混在一起。
4 九个候选的公开价格差很多,价格仍然只回答账单问题
下面的比较固定为 20 万未缓存输入和 2 万输出,按 2026 年 8 月 1 日各家公开费率直接计算。它让数量级一眼可见,同时保留三个边界:人民币不临时换算成美元,Grok 在恰好 200K 输入处存在两份官方页面的档位冲突,任何金额都未包含 tokenizer 差异、推理 token、工具调用、重试和失败任务。
DeepSeek V4 Flash 0731 的参考账单是 0.0336 美元,它是纯文本模型,公开 1M 输入上下文和最大 384K 输出,并同时提供移动 API 别名与 MIT 权重。MiniMax M3 的同口径账单是 0.084 美元,公开原生多模态、1M 上下文以及采用社区许可证的开放权重;GLM 5.2 为 0.368 美元,公开纯文本 1M/128K、函数与 MCP 以及 MIT 权重。价格让三者进入不同预算的试验,许可证、接口同步和本地拓扑仍需逐项闭合。
Gemini 3.6 Flash 的参考账单为 0.45 美元,公开文本、图片、视频、音频和 PDF 输入,窗口为 1,048,576/65,536,并提供搜索、代码执行、文件检索和函数工具。Grok 4.5 的 500K 路线因 200K 档位文字冲突落在 0.52–1.04 美元。Claude Sonnet 5 的文本与图片路线为 1M/128K,8 月 31 日前入门账单 0.60 美元、标准账单 0.90 美元,并提供固定快照规则与符合条件的 ZDR 安排。GPT-5.6 Terra 为 0.64 美元,公开 1.05M/128K、图片输入和较完整的托管工具面。
Kimi K3 的 1M 原生多模态开放权重路线在该示例中为 0.90 美元,本地制品和最低拓扑也进入超大模型规模。Qwen3.7 Max 的日期快照支持文本、图片和视频输入,按全球人民币档为 3.12 元;区域、币种和具体 snapshot 要在采购记录里固定。一次成功代码任务通常包含多轮模型调用、工具回传和修复,失败调用也会计费。真正可比较的单位是达到验收标准的一个任务所需总费用。
生命周期决定结果能否复现。DeepSeek 的公开 API 使用移动别名,调用方保存响应身份;Anthropic 将 Sonnet 5 的无日期 ID 定义为固定快照;Google 把 3.6 Flash 标为稳定;xAI 的裸名和 -latest 会移动;Qwen 同时给出移动别名和日期快照。固定评测使用可固定 ID,本地权重使用提交,移动入口在返回身份变化时自动重跑回归。
5 DeepSeek 的九项发布分数只买到首测资格,真实任务负责淘汰
DeepSeek 为 0731 公布了九项代理结果:Terminal Bench 2.1 为 82.7,NL2Repo 54.2,Cybergym 76.7,DeepSWE 54.4,Toolathlon-Verified 70.3,Agents' Last Exam 25.2,AutomationBench Public 25.1,DSBench-FullStack 68.7,DSBench-Hard 59.6。相对同一发布表中的 Preview,所有项目都有明显提高,尤其 DeepSWE 从 7.3 上升到 54.4。这组数据足以解释首测顺序。
证据边界也由模型卡写得很清楚。公开代码代理题使用 DeepSeek Harness 的 minimal 模式,框架标注为“to be released”,运行 max effort、temperature=1.0、top_p=0.95;DSBench-FullStack 和 DSBench-Hard 属于内部题集。发布表中的 GLM 与 Opus 分数来自厂商收集的比较,当前页面没有交付所有模型的同一容器、工具定义、任务快照、最大轮次、失败重跑和完整日志。
跨厂商总榜会把这些差异压成一列小数。真实代码代理的结果由模型、harness、shell 权限、测试、上下文构建、重试和终止条件共同产生。发布者分数只负责选择进入评测的候选,生产排序只读取自有同任务回放。若 DeepSeek 随后发布固定 Harness 和日志,新增证据可以提高可复核性,旧结果仍要保持其当时版本和设置。
采购判断来自一组小而硬的真实任务。任务按业务失败方式分层:仓库内小修复检查定位和测试纪律;跨文件功能检查规划、上下文和工具循环;迁移与依赖升级检查文档、兼容与回滚;日志诊断检查证据使用;安全任务检查模型是否越过权限或绕开失败测试。每类都保留已知可通过的正控制、必须拒绝的负控制和一个资源故障路径。
评分器只接受可运行结果。候选在隔离 worktree 中修改文件,项目原生测试、静态检查和任务专属断言决定成功;人工评审再看权限、范围、可维护性和隐藏副作用。模型输出“已完成”、生成更多代码或通过自写的宽松测试都不会增加分数。任务失败后记录最早偏离点:上下文遗漏、错误计划、工具参数、测试逃逸、资源终止、拒绝或修复循环。
每个模型至少运行两次同一任务,顺序轮换,避免缓存、服务负载和仓库热状态固定偏向一个候选。评测保存完整用量和费用,失败调用单列;成功任务成本、人工分钟和 p95 只按通过验收的任务计算。这样才能回答用户真正关心的问题:给定团队和仓库,0731 是否比现有后端更快、更便宜地交付可合并结果。
6 从每百万 token 到总成本:低价 API 让本地节点面对很高的利用率门槛
进入本地盈亏平衡以前,只需把 DeepSeek 的费率换成一张账单。本文参考任务使用 20 万未缓存输入和 2 万输出,结果是 0.2×0.14 + 0.02×0.28 = 0.0336 美元。图 2 已经保留其余候选的同口径金额;后面的硬件阈值只用 DeepSeek 这笔账单作分母,避免把同一排价格再念一遍。
Grok 的区间来自可定位的文档差异:模型详情说输入超过 200K 才进入长上下文价,Pricing 表写成 ≥200K,并把输入、缓存和输出同时翻倍。本文的输入恰为 200K,无法靠文字解释消除边界;POC 保存实际 usage 与账单,把供应商计费结果写进采购记录。其余八个候选在 200K 输入处都能确定档位:Terra 尚未越过 272K,Sonnet 5 与 Gemini 3.6 Flash 覆盖整窗统一价,MiniMax 位于 ≤512K 档,Qwen 快照覆盖 0<输入≤1M,DeepSeek、GLM 与 Kimi 当前页面没有另列 200K 阶梯。
这项算术故意保持窄。各模型 tokenizer 不同,20 万相同字符会产生不同 token;reasoning token、图片、音视频、搜索和工具可能改变计量;一次代码任务常有多个调用。缓存也会重写结论:DeepSeek 的命中输入单价只有每百万 0.0028 美元,稳定前缀越大,API 越便宜。评测器因此同时保存原始字节、供应商 token、cache hit/miss 和工具账单,不把示例价格当作实测成本。
本地端的公式是:每个成功任务成本 =(GPU + CPU/内存 + 存储 + 网络 + 电力/机房 + 平台 + 运维 + 冗余的每小时成本)÷ 每节点小时成功任务数。显卡利用率只能说明设备忙,成功任务数才能说明设备交付。队列等待、长上下文 KV cache、失败重试、权重更新、节点故障和低谷空闲都会进入分子或压低分母。
Runpod 2026 年 7 月 27 日更新的公开 Pod 价格给出 H200 每卡小时 4.39 美元、B200 为 5.89 美元、B300 为 7.39 美元。按四卡和每月 730 小时计算,裸 GPU 租金分别是 12,818.80、17,198.80 和 21,578.80 美元。它们没有包含 CPU、内存、存储、网络、镜像下载、值班和冗余,具体 Pod 也要确认四卡是否位于满足互联要求的同一节点;B300 价格不能代替 GB300 报价。
用 0.0336 美元的 DeepSeek 参考任务账单除回去,4×H200 必须完成约 523 个成功参考任务/节点小时,4×B200 约 701 个,4×B300 约 880 个,才触及裸租金线。这个数是所需容量阈值,实际吞吐要在目标上下文、effort、输出、并发和质量门槛下测量。加入双节点冗余、人员和空闲后,盈亏平衡点继续上移;API 缓存命中也会把它推远。
月度场景更直观。每天 100 个参考任务的 DeepSeek API 账单约 100.80 美元;每天 1,000 个约 1,008 美元;每天 10,000 个约 10,080 美元。四卡 H200 的裸租金已经接近第三档,却仍需证明节点每天能稳定交付 10,000 个合格任务,并承担峰值、故障与升级。数据驻留、出网限制、定制 serving 或可预测保留容量可以单独为本地部署创造价值,这份非价格收益应写入采购理由和退出条件。
7 四卡之后,团队购买的是一项模型服务
0731 权重开放后,本地路线终于可以和 API 使用同一产品版本。155.43 GiB 只描述仓库中的权重文件;服务还要容纳运行时、通信缓冲、DSpark、KV cache、批次和上下文。完整 1M 与 384K high/max 输出对显存和时延的影响必须独立测量。官方四卡 GB300 示例给出可运行起点,采购清单仍需按目标并发和序列长度计算。
0731 是精确模型的本地主线。官方提交 7872f01b… 采用 MIT 许可,正式 0731 权重带 DSpark;清单中的权重为 155.43 GiB,Hugging Face 页面按十进制显示约 167 GB。官方模型卡给出 4×GB300,当前以 0731 为默认的 vLLM recipe 给出 H200、B200、B300 四卡 replica 与 8×H200 的 4+4 prefill/decode。按公开 H200 租价,四卡裸租为 17.56 美元/小时;节点互联、CPU、内存、存储、网络、冗余和人员仍需报价与实测。
Qwen3.6-35B-A3B FP8 只做单卡控制。它是 35B 总量、3B 激活的 Apache-2.0 模型,固定清单约 34.89 GiB,原生 262K 上下文;vLLM 提供单 H100、H200 或 MI300X 级路线。它能尽早暴露容器、解析器、工具、队列和观测问题,也能给出 1×H200 约 3,204.70 美元/月的运营基线;这条控制线不承载 0731 的质量结论。
其余三条开放路线暂缓采购。GLM 5.2 的固定 BF16 清单约 1,403.19 GiB,实用 FP8 路线从 8×H200/H20 起,完整 1M 参考使用 8×B200 与 FP8 KV cache。MiniMax M3 的捕获清单约 854 GB BF16,社区许可证的商业署名和收入授权边界、serving 文档与节点报价仍需闭合。Kimi K3 的固定清单约 1,453.74 GiB,2.8T 总量、104B 激活,vLLM recipe 至少使用 8×GB300,并很快进入多节点网络和工具解析治理。它们只有在自有任务明确需要相应能力时才进入下一轮。
部署身份从权重延伸到解析器。下载阶段先解决 167 GB 级对象的来源、断点、校验和镜像。权重与代码进入只读制品库,生产节点从内部镜像拉取;每次发布绑定 Hugging Face 提交、单文件摘要、编码目录、容器和驱动。DeepSeek 模型卡没有 Jinja chat template,提供专用 encoding 脚本;vLLM 的 DeepSeek V4 tokenizer、reasoning parser 和 tool parser 要与固定版本一起验收。解析器漂移可能让相同权重产生不同工具行为。
服务层要定义租户隔离、排队、公平性、限流、超时、取消、流式中断和资源不足的错误合同。长上下文会占用 KV cache,单个巨型请求可能拖慢短请求;调度器需要按上下文和 effort 分池,限制每租户在途 token,并暴露 queue、prefill、decode、KV 驱逐和失败指标。完整一百万上下文只在真实任务获得增益后开放,默认窗口按观测到的有效输入分布配置。
工具执行继续由应用控制。模型服务只生成经过解析的调用意图,策略层核对主体、工具、参数、仓库、路径和副作用额度,执行器运行在独立沙箱,返回结果带大小与敏感字段限制。多租户场景还要验证 prompt/cache 隔离、日志脱敏、制品访问和管理接口认证。本地部署把数据路径收回组织,也把这些责任交给组织。
高可用需要第二份容量或一个托管回退。单节点维护、驱动故障、权重重载和 GPU 错误会让整条路线停机;两套满配节点会直接翻倍大部分固定成本。团队可以选择一主一小型降级池、跨可用区双节点,或本地优先加 DeepSeek API 回退。每种选择都明确数据能否出边界、降级支持哪些任务、缓存是否兼容,以及回到本地前如何确认权重和日志连续。
API、小时租赁和自购设备对应三种不同承诺。API 适合需求波动、任务量尚小和模型仍在快速换代的团队。它把 GPU、内核和可用性运营交给供应商,调用方保留评测、数据治理、工具权限和回滚责任。DeepSeek 当前单价让这条路线覆盖很大的任务量区间;移动别名和公开 beta 状态则要求更严的响应身份记录和回归。
按小时租四卡节点适合数据位置、短期容量实验和 serving 定制。采购方能固定权重与容器,也能随时释放节点;持续下载、空闲和跨区存储会产生额外账单。合同前确认同机互联、共享存储、镜像时间、配额和故障替换,公开的“每卡小时”只有在拓扑满足时才形成可用节点。
自购设备适合稳定高利用率、机房与 GPU 运维已经成熟的组织。总拥有成本包含设备折旧、资金、保修、机架、供电、冷却、交换、备件、人员和利用率机会成本。三年摊销不能掩盖模型六个月后换代的风险;退出路径要允许节点承接其他推理任务,并保留托管 API 兼容层。采购判断最终由成功任务吞吐、政策价值和可复用基础设施共同决定。
8 收口:把 0731 当成一个可撤回的产品变化
对绝大多数团队,最合适的下一步很简单:继续保留现有生产模型,用 DeepSeek 托管 API 跑同一批真实代码任务。它的 0.0336 美元参考账单足够低,能在购买四卡节点以前快速得到质量、工具、延迟和失败证据。多模态任务让 Gemini 3.6 Flash 同场,固定身份或 ZDR 要求让 Claude Sonnet 5 同场;其余模型只在当前工作负载或采购边界需要时加入。
0731 权重的开放改变了数据边界和定制空间,公开提交、MIT 许可和 serving 文档让本地 POC 具备可执行入口。四卡级硬件、155.43 GiB 权重、KV cache、DSpark、解析器和模型服务运营共同构成真实方案。每天几百或几千个长任务仍通常由 API 获得更低的直接成本;高稳定吞吐、数据驻留或已有 GPU 平台可以把本地方案推入首测。
最终的生产答案写在一张版本化决策记录里:任务集提交、候选身份、成功率、人工修复、p50/p95、完整费用、工具副作用、数据路径、容量、故障恢复和回滚结果。0731 达标就灰度,任何关键门槛失守就撤回。下一个模型发布时重复同一合同,团队由此沉淀持续选择模型的能力;静态排行榜会随别名和后端更新迅速过期。
研究依据
研究依据截至 2026-08-01 14:00 CST,复核 DeepSeek V4 Flash 0731 的公开测试、API 身份、定价、上下文、工具接口和同日开放的 MIT 权重;固定 Hugging Face 提交 7872f01b1d1fe23eabc4c98b48bffcef5a386062,并通过 blobs 清单求和 48 个 safetensors 的精确字节;对 DeepSeek 与八个当前托管对照按官方价格计算一项 200K 未缓存输入加 20K 输出的账单示例;对五条本地路线记录官方或框架验证的硬件拓扑、制品体积、许可证和公开 GPU 租金。本文没有在同一任务集上执行跨模型质量、吞吐、延迟、能耗或安全测试,因此公开材料只决定 POC 顺序,生产结论必须由读者自己的仓库任务、工具和成功标准形成。
来源DeepSeek API 文档、更新公告、官方 Hugging Face 权重与固定仓库清单 / OpenAI、Anthropic、Google、Z.ai、Moonshot AI、Alibaba Cloud、xAI、MiniMax 与 Qwen 官方模型和价格资料 / vLLM、SGLang 与 Runpod 官方部署和计价资料 / SOSEC 2026-08-01 身份、价格、权重字节与盈亏平衡复核
证据置信度 中高
9证据与来源
9.1研究范围
2026-08-01 价格页映射到 DeepSeek-V4-Flash-0731 的移动请求标识
SOSEC 固定并读取 blobs 清单的官方 Hugging Face 提交
48 个 safetensors 的清单求和,等于 155.43 GiB
用于解释公开费率的账单算术,不代表跨 tokenizer 的质量或吞吐结果
9.2时间线
- DeepSeek V4 Preview 权重发布
V4 Flash Preview 建立 284B/13B、1M 上下文和 MIT 权重路线,后续 0731 在相同架构上重新后训练。
- V4 Flash 0731 API 进入公开 beta
DeepSeek 更新移动 API 别名、代理成绩、Responses API 与极低价格,公告说明 Harness 和内部题集边界。
- 0731 官方权重进入 Hugging Face
官方仓库和 V4 集合加入 0731;SOSEC 随后固定提交并核算权重字节。
- SOSEC 完成公开信息与成本截面
API 费率、模型身份、本地部署拓扑、公开 GPU 租价和对照模型入口在同一截面复核。
9.3来源与材料
- DeepSeek API 更新公告https://api-docs.deepseek.com/updates/
- DeepSeek 模型、功能、价格与并发https://api-docs.deepseek.com/quick_start/pricing/
- DeepSeek Chat Completions 参数、结束原因、用量与 fingerprinthttps://api-docs.deepseek.com/api/create-chat-completion
- DeepSeek 速率限制与用户隔离https://api-docs.deepseek.com/quick_start/rate_limit
- DeepSeek V4 Flash 0731 官方模型卡、测试、部署与 MIT 许可https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
- 固定 0731 官方权重提交https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731/tree/7872f01b1d1fe23eabc4c98b48bffcef5a386062
- DeepSeek V4 官方模型集合https://huggingface.co/collections/deepseek-ai/deepseek-v4
- vLLM V4 Flash 通用部署 recipe(0731 为当前默认)https://recipes.vllm.ai/deepseek-ai/DeepSeek-V4-Flash
- SGLang DeepSeek V4 部署与调优 cookbookhttps://docs.sglang.io/cookbook/autoregressive/DeepSeek/DeepSeek-V4
- OpenAI GPT-5.6 Terra 官方模型页https://developers.openai.com/api/docs/models/gpt-5.6-terra
- Anthropic Claude 当前模型、价格与上下文https://platform.claude.com/docs/en/about-claude/models/overview
- Anthropic 模型 ID 与版本规则https://platform.claude.com/docs/en/about-claude/models/model-ids-and-versions
- Anthropic 完整计价与 Sonnet 5 全上下文统一费率https://platform.claude.com/docs/en/about-claude/pricing
- Anthropic Sonnet 5 tokenizer、上下文与 ZDR 说明https://platform.claude.com/docs/en/about-claude/models/whats-new-sonnet-5
- Anthropic API 数据保留与 ZDR 资格边界https://platform.claude.com/docs/en/manage-claude/api-and-data-retention
- Google Gemini 3.6 Flash 官方模型页https://ai.google.dev/gemini-api/docs/models/gemini-3.6-flash
- Google Gemini API 官方价格https://ai.google.dev/gemini-api/docs/pricing
- Z.ai GLM 5.2 模型与接口https://docs.z.ai/guides/llm/glm-5.2
- Z.ai 官方模型价格https://docs.z.ai/guides/overview/pricing
- GLM 5.2 官方开放权重https://huggingface.co/zai-org/GLM-5.2
- vLLM GLM 5.2 部署 recipehttps://recipes.vllm.ai/zai-org/GLM-5.2
- Kimi API 模型与价格https://platform.kimi.ai/
- Kimi K3 官方模型卡与许可证https://huggingface.co/moonshotai/Kimi-K3
- vLLM Kimi K3 部署 recipehttps://recipes.vllm.ai/moonshotai/Kimi-K3
- Alibaba Cloud Model Studio 文本模型列表与快照https://help.aliyun.com/en/model-studio/text-generation-model
- Alibaba Cloud Qwen3.7 Max 快照与视觉能力发布记录https://help.aliyun.com/en/model-studio/newly-released-models
- Alibaba Cloud Model Studio 官方价格https://help.aliyun.com/en/model-studio/model-pricing
- xAI 当前模型、身份与价格https://docs.x.ai/developers/models
- xAI Grok 4.5 模型详情与 200K 边界说明https://docs.x.ai/developers/models/grok-4.5
- xAI 全模型价格与 ≥200K 长上下文表https://docs.x.ai/developers/pricing
- MiniMax 当前 API 价格https://platform.minimax.io/subscribe/token-plan?tab=api-enterprise
- MiniMax M3 官方权重与许可证https://huggingface.co/MiniMaxAI/MiniMax-M3
- MiniMax M3 社区许可证全文https://huggingface.co/MiniMaxAI/MiniMax-M3/blob/main/LICENSE
- Qwen3.6-35B-A3B 官方模型卡https://huggingface.co/Qwen/Qwen3.6-35B-A3B
- Qwen3.6-35B-A3B 官方 FP8 权重https://huggingface.co/Qwen/Qwen3.6-35B-A3B-FP8
- vLLM Qwen3.6-35B-A3B 单卡部署 recipehttps://recipes.vllm.ai/Qwen/Qwen3.6-35B-A3B
- Runpod GPU Pod 公开价格https://www.runpod.io/pricing