AI界的「牛来」了,AGI时刻之前,注意力是如何转移的?
8 月 26 日阿里智谱同夜开源 Qwen3.8-Flash 和 GLM-5.3-Flash(匿名模型「牛来」),全行业涨价它俩逆势砍价——注意力正从「性能第一」挪向「够用够快」,下一次核爆是 AGI。
8 月 26 日这晚间,「牛来」了,当然这次是 AI 圈的牛来了。
阿里千问、智谱在 24 小时内先后亮剑:Qwen3.8-Flash 和 GLM-5.3-Flash,都开源,且都宣称性能超过 Opus 4.6、逼近 Opus 4.8,价格都压到 DeepSeek 的几分之一。性能、价格都摆在那儿,要关注的是另一个信号——所有人都在涨价,只有这两家逆势砍价;砍价是手段,抢注意力才是目的。
这一夜看着是价格战,其实是一串注意力转移:DeepSeek 用 0.2 元的价格锚,把注意力从「谁最强」拽到「谁最便宜」;「牛来」用匿名加免费,把它从「比价」拽到「猜底牌」;阿里智谱用架构,把斩杀线的刻度从「每 token」换成「每任务」;字节腾讯用应用入口,把战场从「卖 API」挪到「占入口」。四步走完,注意力已经离开「性能第一」,落到「够用够快」——下一次能把它重新引爆的,只剩 AGI。
一、全行业在涨价
Qwen3.8-Flash 发布之前,大模型的价格曲线已经集体掉头。
- DeepSeek 先调价:8 月 17 日,V4 全系启用峰谷分时计费,高峰输出回到旧价的 4.7 倍。它走的本是普惠路线,这次调价,是扛不住这么多人用,用价格赶走一部分需求。
- 巨头实打实地涨:OpenAI、谷歌、Anthropic 相继上调 API 价格或收缩免费额度。
原因其实也不复杂:推理需求跑赢算力供给,Agent 应用把一次调用拆成几十次,账单从「一问一答」变成「一个任务跑几小时」。低价扛不住,只能涨价。
就在这个全行业涨价的月份,阿里和智谱逆势压价。
二、注意力第一次转移:性能 → 价格(DeepSeek 的价格锚)
第一次转移发生在价格上:DeepSeek 用一枚价格锚,把注意力从「谁最强」拽到「谁最便宜」。
2026 年 4 月 24 日,DeepSeek 发布 V4 预览版。定位「经济之选」的 V4-Flash,2840 亿总参数、激活 130 亿,缓存命中输入低到 0.2 元/百万 tokens。
当时主流模型还在按「每百万 tokens 几美元」计价,DeepSeek 直接把价格按进地板。
这个「价格锚点」悬在所有厂商头顶。大模型切换成本极低,开发者换底层模型几乎没有迁移负担;一款模型性价比一旦落到某条线以下,失去的不是缓慢的份额,而是商业存在感。这条线后来被叫「斩杀线」。
三、注意力第二次转移:价格 → 神秘(「牛来」匿名登场)
第二次转移更狡黠:「牛来」匿名上线,把「比价」变成「猜底牌」。
市场刚适应 DeepSeek 的价格统治,8 月 21 日,一个代号 Ox Alpha 的匿名模型上线。完全免费,性能能打,使用量一度冲到 DeepSeek 的两倍以上。代号「Ox」意为公牛,网友叫它「牛来」。
全网都在猜是谁的底牌。有人猜小米,有人猜谷歌。8 月 26 日,智谱揭晓:「牛来」就是 GLM-5.3-Flash。
这招匿名偷袭没有品牌包袱,用免费策略测市场反应,顺手收割口碑。配套的《牛之馈赠》体验卡海报,新朋友免费领 7 天、每天仅限 1 万张——免费+限量,正是抢注意力的标准打法。智谱官方还披露一个细节:**「牛来」的全部调用流量,都由国产芯片提供算力。**大规模生产环境里扛住顶级流量的实战检验。
四、阿里掀桌:Qwen3.8-Flash
智谱刚认领完「牛来」,当晚阿里千问发布 Qwen3.8-Flash。
同为 MoE 架构,1250 亿总参数只激活 60 亿,训练成本骤降 90%。定价输入 1 元、输出 3 元/百万 tokens,击穿 DeepSeek V4-Flash 调价后的闲时价。但杀招不在价格,在架构。
性能:6B 激活参数打顶级战绩
| 基准测试 | Qwen3.8-Flash | 对比对手 | 差距 |
|---|---|---|---|
| DeepSWE 1.1(智能体编程) | 58.7 | Qwen3.7-Plus(参数 3 倍) | 16.5 |
| CoWorkBench(长周期办公) | 73.9 | Claude Opus 4.6(Max) | 68.2 |
| JobBench(专业岗位) | 55.7 | Claude Opus 4.6(Max) | 36.6 |
HLE 上 35.9 分仍落后 Opus 4.6 的 40.0 分,但多数实用场景已经能正面抗衡。
架构:Qwen4 的骨架提前亮相
- 混合注意力:GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention),对 Transformer 注意力机制的底层重构,不是简单压缩。
- N-gram Embedding:额外 51B,不增加推理成本,提知识密度。
- Qwen4 预览版:开源版本 Qwen3.8-Flash-Next 被明确定义为「Qwen4 架构的早期预览」。阿里把下一代架构的核心能力提前以 Flash 版本释放,收集真实反馈,用技术代差压对手。
五、智谱的底牌
继 DeepSeek 投身架构精进并参与配合改进国产芯片之后,智谱也走上了这条路。
GLM-5.3-Flash 的低成本不是靠堆数据或压参数硬挤,是架构重构:
- 混合架构:线性注意力 + 稀疏注意力,保长上下文精度的同时降服务成本。注意力计算量降 3.01 倍,KV 缓存降 4.44 倍。
- 原生多模态:视觉能力原生进推理闭环,模型自己判断何时该「看」,用视觉反馈指导下一步。在 Blender 里,它自主运行 16 小时搭了约 400 平方米的专业主厨自宅与测试厨房。
- 国产芯片实战:EPD(Encode-Prefill-Decode)分离式架构加内存优化,国产芯片端到端服务性能提升 3 倍,单 token 成本已与主流英伟达 GPU 相当。
六、注意力第三次转移:每 token → 每任务(斩杀线换刻度)
第三次转移在刻度上:阿里和智谱用架构,把斩杀线从「每 token」换成「每任务」。
衡量单位不再是「每百万 token 多少钱」,而是「跑完一项真实任务要花多少钱」。Artificial Analysis 的数据:
| 模型 | 智能指数 | 每任务成本 |
|---|---|---|
| Claude Opus 4.8 | 57 | $2.03 |
| DeepSeek V4 Pro | 53 | $0.25 |
| DeepSeek V4 Flash 0731 | 52 | $0.11 |
| GPT-5.6 Luna | 52 | $0.05 |
Opus 4.8 跑完一项任务要 2.03 美元,GPT-5.6 Luna 只要 0.05 美元,差约 40 倍。这就不是「价格高低」的问题,是「商业模式能不能成立」的问题。Qwen3.8-Flash 和 GLM-5.3-Flash 的定价,就落在这条新斩杀线上。
顺带回答一个疑问:DeepSeek 这轮是不是掉到斩杀线下了?按旧的「每 token」刻度,是——Qwen3.8-Flash 的 1 元/3 元,击穿了它调价后的闲时价。但斩杀线的刻度已经换成「每任务」,DeepSeek V4 Flash 0731 每任务成本 0.11 美元,还在线内。它真正丢的不是价格,是注意力的中心位。还有一点:涨价从来不是战略,是需求管理——一旦用户分流、算力空转,降价随时会回来。价格战不是打完就结束,是循环。
七、注意力第四次转移:每任务 → 每入口(应用粘住注意力)
第四次转移发生在入口上。API 按 token 卖,切换成本几乎为零——开发者今天换底层模型,明天就能换回来。所以价格战打到每任务美分级,就打到头了:再便宜,也是「谁都留不住」的生意。下一格战场,是让用户离不开你的「入口」。
同一周,字节已经动手。7 月 30 日,飞书团队整体并入豆包——30 亿 ARR 的协作入口被拆开、并进 AI;8 月 24 日,TRAE 和扣子并入豆包;8 月 25 日,「豆包工作」发布,与飞书深度打通。三件事一个意思:不再把大模型当 API 卖,而是嵌进工作流、企业知识、账号体系里。应用粘的不是模型能力,是工作流 + 企业知识 + 账号——这三样切换成本极高,用户一旦进去就难出来。
腾讯的 WorkBuddy 是催化剂:百万日活的 AI 办公入口,证明「AI 办公」这条赛道有真实的注意力盘子。阿里走同一路:QoderWork、MuleRun、悟空几个办公 AI 产品,合并成「千问办公」。三家朝同一个方向加注——从「卖能力」转向「占入口」。
斩杀线因此又抬高一格。上一格换的是刻度(每 token → 每任务),这一格换的是战场(每任务 → 每入口)。价格和速度只是门票,入口才是终点。
八、后半场
这场由 DeepSeek 点燃、由「牛来」引爆、由阿里智谱接力的降价战,剩下几件事:
- **对参数麻木了。**没人在乎总参数多少,只在乎激活多少、回答一个问题几分钱。GLM-5.3-Flash 用 320 亿总参数(激活 18 亿)做到与 Opus 4.8 持平的 57 分。
- **斩杀线继续上移。**当每任务成本被打到美分级,还停在美元级的模型会迅速失去存在感。
- **闭源护城河变浅。**开源模型以几十分之一的价格给到接近 Opus 4.8 的性能,闭源只剩「数据安全」和「企业服务」两条浅沟。Claude Code 就是注脚:ARR 环比增速从年初超 600% 跌到 8 月的 5.2%,同期 Codex 是 20.8%,隐形水印政策还引发退订争议。
- 国产算力不再是备胎。「牛来」在国产芯片上扛住峰值流量,说明国产算力具备大规模商用可行性。
- **开源成了核威慑。**中国开源模型下载量占全球 41%,首次超过美国。阿里把旗舰级开源,智谱把 Ox Alpha 免费——不开源,连上牌桌的资格都没有。
对于开发者,这是好时代:几块钱让模型写本小说、设计一套厨房、审一份合同。对于大模型厂商,上半场比谁跑得快,下半场比谁活得久——筹码不是更炫的 Demo,是更极致的成本控制、更硬核的架构、更自主的算力底座。
九、过了门槛,争的是注意力
归根结底,Qwen 和智谱抢的,是比「性能第一」更关乎发展生存的东西。
能力过了「实用够用线」——编程、办公、岗位这些真实任务不再翻车——之后,除了少数把模型逼到 HLE 这类前沿题的重度用户,大多数人分不出 57 分和 52 分的差别。大家更在意的,是便宜、是快——前提是质量不塌。Qwen3.8-Flash 和 GLM-5.3-Flash 卡的就是这个位置:能力够用,价格和速度拉满。
用户、流量、影响力,本质都是同一件事——注意力。GPT 的价格和策略隔一阵就重置一次,一边拉新用户,一边抢注意力。很多东西和 AI 一样,价值不在自己手里,在别人愿意花多少注意力看你。谁能控制注意力,谁就能抓住重点。
争 SOTA 也一样——刷榜第一,本质是抢注意力。只是过了少数一两家争雄的年代,榜单轮流换人,大家早看麻了。下一次能重新引爆所有人注意力的,只剩一件事:突破到 AGI。
而且「性能」这个标的本身也不干净。它一半是真能力,一半是打榜和做秀——刷 benchmark 炒分数、发 PR 炒「最强」,用「强」抢注意力。还有一条更隐蔽的路:危言耸听。Fable 5 那阵,Anthropic 一边喊「Mythos 级、史上最强」,一边到国会要求立法限制——「强」和「危险」互相矛盾却能同时喊,说明都是手段,不是事实。而「危险」这副面具抢的不是流量,是规则制定权:让国会出手,等于给没赶上牌桌的对手设门槛。这比降价狠得多。
「牛来」了。它是技术狂飙和市场内卷的合力结果。方向只有一个:向前,向应用,向每一个真实的需求。