文/观网硬科技
8月12日深夜,DeepSeek官网API文档更新,模型版本从V4-Pro预览版切换为“DeepSeek-V4-Pro-0813”。几乎同一时间,马斯克旗下SpaceXAI发布了新一代模型Grok 4.6。
两款主打高性价比的模型同夜撞车,梁文锋与马斯克的双强对垒,真正感受到压力的可能是OpenAI和Anthropic。
从DeepSeek官方群流出的一张评测对比表显示,V4 Pro正式版在多项智能体测试中表现亮眼。在衡量AI智能体完成真实终端环境复杂任务能力的Terminal Bench 2.1上,V4 Pro拿下87.9分,距离全球第一的Anthropic Fable 5仅差0.1分。相比预览版72.1分的成绩,三个月跃升了15.8分。
在AI安全智能体基准Cybergym上,V4 Pro以83.3分压过Fable 5的83.1分;在工作流智能体测试AutomationBench中,31.8分对29.1分同样胜出。
衡量软件工程能力的DeepSWE上,分数从预览版的12.8分飙升至62.7分,接近原来的五倍,超越了Anthropic上一代旗舰Opus 4.8的58.0分。V4 Pro正式版支持100万Token上下文长度,最大输出384K Token,并兼容OpenAI和Anthropic两种API格式,开发者几乎无需修改代码即可完成切换。
智能体是理解这次升级的关键。Terminal Bench、DeepSWE这类测试考察的是AI能不能真正“干活”——调用工具、执行多步骤任务、编写和修改代码、在长链条中持续推进直到交付结果。这正是大模型从聊天玩具走向生产工具的核心门槛。
就在V4 Pro上线前几个小时,马斯克旗下SpaceXAI发布的Grok 4.6同样剑指长周期智能体任务。在面向真实知识工作的GDPVal-AA v2评估中,Grok 4.6以1753 Elo登顶,超过了Fable 5的1741和GPT-5.6 Sol Max的1728。两款模型不约而同地将矛头指向同一件事:让AI在长任务中稳定交付可用成果。
然而价格差距令人咋舌。Fable 5每百万输出Token定价50美元,GPT-5.6 Sol Max为30美元,Grok 4.6为6美元,而DeepSeek V4 Pro仅为0.87美元,约为Fable 5的五十七分之一。0.1分的跑分差距背后,是五十七倍的价格鸿沟。
DeepSeek此次发布的另一重看点,是其智能体工具“Harness”的推进。有媒体报道,DeepSeek Harness于2026年5月内部立项,由崔添翼担任负责人。
崔添翼毕业于浙江大学计算机系,曾在量化交易机构Jane Street任职九年,2026年3月加入DeepSeek。“DeepSeek Harness团队”公众号已于今年7月6日正式注册。8月1日,崔添翼曾面向全球公开征集Harness内测用户。
性能飙升的同时,涨价预告也随之而来。8月6日,DeepSeek在开放平台发布公告,计划近期整体上调API服务定价,预计涨幅较大。这是DeepSeek首次预告整体上调API价格,而非此前针对高峰时段的局部调整。
梳理其定价时间线:4月V4发布时,V4 Pro API以2.5折优惠上线;5月31日优惠结束后,直接永久降至原价的四分之一;6月29日又引入峰谷计费。从永久降价到预告大涨,中间只隔了两个多月。
如果只把涨价理解为“扛不住成本”,可能低估了DeepSeek的意图。仅仅两个月前的6月16日,DeepSeek刚刚完成成立以来首轮外部融资,募资总额超过500亿元人民币,投后估值突破3500亿元,创下中国AI行业单轮融资纪录。
最新消息显示,DeepSeek已在推动第二轮融资,计划募资约500亿元,投前估值约5000亿元。摩根士丹利8月9日发布的研报给出了三个驱动因素:V4模型需求旺盛支撑了更强的定价能力;厂商需要在市场份额与毛利率之间寻求平衡,以持续投入前沿模型研发;更多使用国产芯片可能带来更高的推理成本。
报告认为,模型智能而非价格,才是大模型竞争的终极壁垒。
DeepSeek的涨价并非孤例。据摩根士丹利统计,以字节跳动、阿里、百度、腾讯、智谱、月之暗面、MiniMax及DeepSeek为样本,中国大模型平均API输出价格已从2025年一季度的约12.2元/百万Token回升至2026年二季度的21.9元/百万Token。智谱API定价较去年底累计上调约83%,但调用量反而增长了400%。腾讯在3月至4月间两轮上调模型API价格,部分涨幅高达463%。
纵观整个AI行业,算力供需、芯片采购成本、运营成本持续走高,单纯靠低价换规模的模式难以为继。当头部厂商都不再以价格为唯一竞争手段,行业下半场的焦点已经明确:不是谁更便宜,而是谁真能解决问题。