Gate News 消息,4 月 27 日——SemiAnalysis,一家半导体与 AI 分析公司,发布了包含 GPT-5.5、Claude Opus 4.7 和 DeepSeek V4 在内的代码助手对比基准测试。关键发现:GPT-5.5 标志着 OpenAI 在六个月后首次重返编程模型前沿;随后 SemiAnalysis 工程师在 Codex 和 Claude Code 之间交替使用;此前他们几乎完全依赖 Claude。GPT-5.5 基于代号为 “Spud” 的新预训练方法,代表 OpenAI 自 GPT-4.5 以来首次扩展预训练规模。
在实际测试中,出现了明确的分工。Claude 负责新的项目规划与初始搭建,而 Codex 在推理密集型的漏洞修复方面表现更出色。Codex 展现出更强的数据结构理解与逻辑推理能力,但在推断含糊的用户意图方面存在困难。在一个单一的仪表盘任务上,Claude 会自动复刻参考页面布局,但会捏造大量数据;而 Codex 跳过布局,却提供了显著更准确的数据。
分析揭示了一个基准测试操纵细节:OpenAI 2 月的一篇博客文章敦促业界将 SWE-bench Pro 作为代码基准测试的新标准。然而,GPT-5.5 的公告改用了一个名为 “Expert-SWE” 的新基准。原因被藏在细微的说明中:GPT-5.5 在 SWE-bench Pro 上被 Opus 4.7 超越,并且与 Anthropic 尚未发布的 Mythos (77.8%) 相比差距巨大。
关于 Opus 4.7,Anthropic 在发布后一周发表了死后复盘分析,承认 Claude Code 中存在三个在 3 月至 4 月持续了数周、影响近乎所有用户的漏洞。多名工程师此前曾报告 4.6 版本的性能下降,但这些说法被当作主观观察而否定。此外,Opus 4.7 的新分词器会使 token 使用量最高增加 35%,而 Anthropic 公开承认了这一点——本质上相当于隐性涨价。
DeepSeek V4 被评为 “跟上前沿但并不领先”,将自己定位为封闭源模型中成本最低的替代方案。分析还指出,“Claude 在高难度中文写作任务上继续优于 DeepSeek V4 Pro”,并评论道:“Claude 在它自己的语言上赢过了中文模型。”
文章提出了一个关键概念:模型定价应通过 “每任务成本(cost per task)” 来评估,而不是通过 “每 token 成本(cost per token)”。GPT-5.5 的定价是 GPT-5.4 的两倍 (input $5, output $30 per million tokens),但它使用更少的 tokens 完成相同的任务,因此实际成本未必更高。最初的 SemiAnalysis 数据显示,Codex 的输入到输出比例为 80:1,低于 Claude Code 的 100:1。
免责声明:本页面信息可能来自第三方,不代表 Gate 的观点或意见。页面显示的内容仅供参考,不构成任何财务、投资或法律建议。Gate 对信息的准确性、完整性不作保证,对因使用本信息而产生的任何损失不承担责任。虚拟资产投资属高风险行为,价格波动剧烈,您可能损失全部投资本金。请充分了解相关风险,并根据自身财务状况和风险承受能力谨慎决策。具体内容详见
声明。
相关文章
科罗拉多州立法者提出以 AI 法替代方案来解决行业担忧
科罗拉多州立法者正着手废除并取代该州 2024 年的人工智能法案 SB24-205,并以新规则替换。新规则将缩小 AI 监管的范围,同时回应行业对合规负担的担忧。新的提案 SB26-189 将监管所使用的 AI 系统,其中包括
Crypto Frontier3小时前
R0AR 进入 Consensus 2026 PitchFest 决赛轮,勉强错失前 20 名
根据 MetaversePost,R0AR 于 5 月 4 日晋级 CoinDesk 2026 PitchFest 的最终遴选轮,险些错过入选现场路演的前 20 家初创企业。这位 Web3 和 AI 创新者与全球其他高潜力初创企业一同接受评估,位于行业的其中一个 m
GateNews6小时前
马斯克在开庭前寻求向 OpenAI 达成 1500 亿美元和解,和解谈判失败
根据一份法院文件,埃隆·马斯克于 4 月 26 日联系了 OpenAI 总裁 Greg Brockman——在他们于奥克兰联邦法院开庭的前两天——以探讨和解。 当 Brockman 建议双方都放弃各自的主张时,马斯克以威胁回应,告诉 Brockman:“到年底
GateNews7小时前
Cursor 接受 SpaceX 的 600 亿美元收购要约,但不会与 xAI 在编码模型方面合作
据 The Information 称,Cursor 已接受来自 SpaceX 的一项附条件 600 亿美元收购要约,尽管该交易尚未最终敲定。该公司目前没有计划与 SpaceX 的 AI 部门 xAI 合作开发编码模型。相反,Cursor 正在专注于对其进行优化
GateNews7小时前
Haun Ventures 在 5 月 4 日关闭 10 亿美元基金,在早期与后期加密投资之间分配资本
据 Bloomberg 称,Haun Ventures 于 5 月 4 日完成了一轮 10 亿美元的融资,其中 5 亿美元用于早期投资,5 亿美元用于后期投资。该基金将在未来两到三年内部署资金,面向加密货币和区块链初创企业,同时扩展
GateNews7小时前
OpenAI 为部署合资企业筹集 $4 十亿,估值 100 亿美元
据 BlockBeats 称,在 5 月 4 日,OpenAI 融资超 $4 billion(应按规模词转换为中文“亿/万亿”等表达),以设立一家新的合资企业,专注于帮助企业采用其人工智能软件。该企业名为 The Deployment Company,由包括 TPG Inc.、Brookfield Asset Management 在内的 19 家投资者支持,
GateNews8小时前