硅谷最后的倾销:GPT-5.6 Luna 暴跌 80% 与大模型终局
这是一场硅谷历史上最惨烈的定价权争夺战。OpenAI 刚刚发布的 GPT-5.6 系列中,Luna 模型的推理成本断崖式下跌了 80%。这不仅是技术进步的红利,更是算力泡沫破碎前的最后倾销。
性能数据分析
- SWE-Bench Pro(软件工程能力):Sol 64.6%,Terra 63.4%,Luna 62.7%。相比 GPT-5.5 的 59.4%,即便是定位最轻量的 Luna 也实现了跨代超越。
- Capture the Flag(网络安全/攻防):Sol 96.7%,Terra 91.8%,Luna 85.2%。相比 GPT-5.5 的 82.1%,这一跨越意味着大模型在复杂逻辑链路下的生存能力已趋于成熟。
- LifeSciBench(生命科学研究):Sol 59.9%,Terra 56.2%,Luna 52.3%。相比 GPT-5.5 的 50.4%,各模型在垂直专业领域均保持了显著增益。
宏观背景
- 算力基建泡沫:NVIDIA H100 二手市场价格已从 3.5 万美元的高位崩至 1.2-1.5 万美元。供应过剩与大厂削减资本开支的阴影笼罩着整个行业。
- 能源瓶颈:北弗吉尼亚等全球数据中心枢纽正面临电力网扩容极限,单纯通过堆叠卡数换取智能的边际成本已不可持续。
- 从大脑到手脚:价值中枢正在从纯粹的“智能思考”向“执行能力”转移。像 Devin 和 Poke 这样具备真实操作环境接入(Hand-and-foot capability)的 Agent,才是这场终局之战的真正主角。
在大模型推理价格趋向于零的时代,单纯的智力输出已不再是稀缺品,能够深入业务流进行闭环执行的“代理人”将接管硅谷的下一个十年。