# AI界的「牛来」了，AGI时刻之前，注意力是如何转移的？


8 月 26 日这晚间，「牛来」了，当然这次是 AI 圈的牛来了。

阿里千问、智谱在 24 小时内先后亮剑：Qwen3.8-Flash 和 GLM-5.3-Flash，都开源，且都宣称性能超过 Opus 4.6、逼近 Opus 4.8，价格都压到 DeepSeek 的几分之一。性能、价格都摆在那儿，要关注的是另一个信号——**所有人都在涨价，只有这两家逆势砍价；砍价是手段，抢注意力才是目的。**

这一夜看着是价格战，其实是一串注意力转移：DeepSeek 用 0.2 元的价格锚，把注意力从「谁最强」拽到「谁最便宜」；「牛来」用匿名加免费，把它从「比价」拽到「猜底牌」；阿里智谱用架构，把斩杀线的刻度从「每 token」换成「每任务」；字节腾讯用应用入口，把战场从「卖 API」挪到「占入口」。四步走完，注意力已经离开「性能第一」，落到「够用够快」——下一次能把它重新引爆的，只剩 AGI。

## 一、全行业在涨价

Qwen3.8-Flash 发布之前，大模型的价格曲线已经集体掉头。

- **DeepSeek 先调价**：8 月 17 日，V4 全系启用峰谷分时计费，高峰输出回到旧价的 4.7 倍。它走的本是普惠路线，这次调价，是扛不住这么多人用，用价格赶走一部分需求。
- **巨头实打实地涨**：OpenAI、谷歌、Anthropic 相继上调 API 价格或收缩免费额度。

原因其实也不复杂：推理需求跑赢算力供给，Agent 应用把一次调用拆成几十次，账单从「一问一答」变成「一个任务跑几小时」。低价扛不住，只能涨价。

就在这个全行业涨价的月份，阿里和智谱逆势压价。

## 二、注意力第一次转移：性能 → 价格（DeepSeek 的价格锚）

第一次转移发生在价格上：DeepSeek 用一枚价格锚，把注意力从「谁最强」拽到「谁最便宜」。

2026 年 4 月 24 日，DeepSeek 发布 V4 预览版。定位「经济之选」的 V4-Flash，2840 亿总参数、激活 130 亿，缓存命中输入低到 0.2 元/百万 tokens。

当时主流模型还在按「每百万 tokens 几美元」计价，DeepSeek 直接把价格按进地板。

这个「价格锚点」悬在所有厂商头顶。大模型切换成本极低，开发者换底层模型几乎没有迁移负担；一款模型性价比一旦落到某条线以下，失去的不是缓慢的份额，而是商业存在感。这条线后来被叫「斩杀线」。

## 三、注意力第二次转移：价格 → 神秘（「牛来」匿名登场）

第二次转移更狡黠：「牛来」匿名上线，把「比价」变成「猜底牌」。

市场刚适应 DeepSeek 的价格统治，8 月 21 日，一个代号 **Ox Alpha** 的匿名模型上线。完全免费，性能能打，使用量一度冲到 DeepSeek 的两倍以上。代号「Ox」意为公牛，网友叫它「牛来」。

全网都在猜是谁的底牌。有人猜小米，有人猜谷歌。8 月 26 日，智谱揭晓：**「牛来」就是 GLM-5.3-Flash。**

这招匿名偷袭没有品牌包袱，用免费策略测市场反应，顺手收割口碑。配套的《牛之馈赠》体验卡海报，新朋友免费领 7 天、每天仅限 1 万张——免费+限量，正是抢注意力的标准打法。智谱官方还披露一个细节：**「牛来」的全部调用流量，都由国产芯片提供算力。**大规模生产环境里扛住顶级流量的实战检验。

<div style="text-align:center;">

{{< image src="niulaile.jpg" alt="牛来《牛之馈赠》免费体验卡海报" width="400px" linked=false >}}

</div>

## 四、阿里掀桌：Qwen3.8-Flash

智谱刚认领完「牛来」，当晚阿里千问发布 Qwen3.8-Flash。

同为 MoE 架构，1250 亿总参数只激活 60 亿，训练成本骤降 90%。定价输入 1 元、输出 3 元/百万 tokens，击穿 DeepSeek V4-Flash 调价后的闲时价。但杀招不在价格，在架构。

### 性能：6B 激活参数打顶级战绩

| 基准测试 | Qwen3.8-Flash | 对比对手 | 差距 |
| :--- | :--- | :--- | :--- |
| DeepSWE 1.1（智能体编程） | 58.7 | Qwen3.7-Plus（参数 3 倍） | 16.5 |
| CoWorkBench（长周期办公） | 73.9 | Claude Opus 4.6（Max） | 68.2 |
| JobBench（专业岗位） | 55.7 | Claude Opus 4.6（Max） | 36.6 |

HLE 上 35.9 分仍落后 Opus 4.6 的 40.0 分，但多数实用场景已经能正面抗衡。

### 架构：Qwen4 的骨架提前亮相

- **混合注意力**：GDN（Gated DeltaNet）+ QSA（Qwen Sparse Attention），对 Transformer 注意力机制的底层重构，不是简单压缩。
- **N-gram Embedding**：额外 51B，不增加推理成本，提知识密度。
- **Qwen4 预览版**：开源版本 Qwen3.8-Flash-Next 被明确定义为「Qwen4 架构的早期预览」。阿里把下一代架构的核心能力提前以 Flash 版本释放，收集真实反馈，用技术代差压对手。

## 五、智谱的底牌

继 DeepSeek 投身架构精进并参与配合改进国产芯片之后，智谱也走上了这条路。

GLM-5.3-Flash 的低成本不是靠堆数据或压参数硬挤，是架构重构：

- **混合架构**：线性注意力 + 稀疏注意力，保长上下文精度的同时降服务成本。注意力计算量降 3.01 倍，KV 缓存降 4.44 倍。
- **原生多模态**：视觉能力原生进推理闭环，模型自己判断何时该「看」，用视觉反馈指导下一步。在 Blender 里，它自主运行 16 小时搭了约 400 平方米的专业主厨自宅与测试厨房。
- **国产芯片实战**：EPD（Encode-Prefill-Decode）分离式架构加内存优化，国产芯片端到端服务性能提升 3 倍，单 token 成本已与主流英伟达 GPU 相当。

## 六、注意力第三次转移：每 token → 每任务（斩杀线换刻度）

第三次转移在刻度上：阿里和智谱用架构，把斩杀线从「每 token」换成「每任务」。

衡量单位不再是「每百万 token 多少钱」，而是「跑完一项真实任务要花多少钱」。Artificial Analysis 的数据：

| 模型 | 智能指数 | 每任务成本 |
| :--- | :--- | :--- |
| Claude Opus 4.8 | 57 | $2.03 |
| DeepSeek V4 Pro | 53 | $0.25 |
| DeepSeek V4 Flash 0731 | 52 | $0.11 |
| GPT-5.6 Luna | 52 | $0.05 |

Opus 4.8 跑完一项任务要 2.03 美元，GPT-5.6 Luna 只要 0.05 美元，差约 40 倍。这就不是「价格高低」的问题，是「商业模式能不能成立」的问题。Qwen3.8-Flash 和 GLM-5.3-Flash 的定价，就落在这条新斩杀线上。

顺带回答一个疑问：DeepSeek 这轮是不是掉到斩杀线下了？按旧的「每 token」刻度，是——Qwen3.8-Flash 的 1 元/3 元，击穿了它调价后的闲时价。但斩杀线的刻度已经换成「每任务」，DeepSeek V4 Flash 0731 每任务成本 0.11 美元，还在线内。它真正丢的不是价格，是注意力的中心位。还有一点：涨价从来不是战略，是需求管理——一旦用户分流、算力空转，降价随时会回来。价格战不是打完就结束，是循环。

## 七、注意力第四次转移：每任务 → 每入口（应用粘住注意力）

第四次转移发生在入口上。API 按 token 卖，切换成本几乎为零——开发者今天换底层模型，明天就能换回来。所以价格战打到每任务美分级，就打到头了：再便宜，也是「谁都留不住」的生意。下一格战场，是让用户离不开你的「入口」。

同一周，字节已经动手。7 月 30 日，飞书团队整体并入豆包——30 亿 ARR 的协作入口被拆开、并进 AI；8 月 24 日，TRAE 和扣子并入豆包；8 月 25 日，「豆包工作」发布，与飞书深度打通。三件事一个意思：不再把大模型当 API 卖，而是嵌进工作流、企业知识、账号体系里。应用粘的不是模型能力，是工作流 + 企业知识 + 账号——这三样切换成本极高，用户一旦进去就难出来。

腾讯的 WorkBuddy 是催化剂：百万日活的 AI 办公入口，证明「AI 办公」这条赛道有真实的注意力盘子。阿里走同一路：QoderWork、MuleRun、悟空几个办公 AI 产品，合并成「千问办公」。三家朝同一个方向加注——从「卖能力」转向「占入口」。

斩杀线因此又抬高一格。上一格换的是刻度（每 token → 每任务），这一格换的是战场（每任务 → 每入口）。价格和速度只是门票，入口才是终点。

## 八、后半场

这场由 DeepSeek 点燃、由「牛来」引爆、由阿里智谱接力的降价战，剩下几件事：

1. **对参数麻木了。**没人在乎总参数多少，只在乎激活多少、回答一个问题几分钱。GLM-5.3-Flash 用 320 亿总参数（激活 18 亿）做到与 Opus 4.8 持平的 57 分。
2. **斩杀线继续上移。**当每任务成本被打到美分级，还停在美元级的模型会迅速失去存在感。
3. **闭源护城河变浅。**开源模型以几十分之一的价格给到接近 Opus 4.8 的性能，闭源只剩「数据安全」和「企业服务」两条浅沟。Claude Code 就是注脚：ARR 环比增速从年初超 600% 跌到 8 月的 5.2%，同期 Codex 是 20.8%，隐形水印政策还引发退订争议。
4. **国产算力不再是备胎。**「牛来」在国产芯片上扛住峰值流量，说明国产算力具备大规模商用可行性。
5. **开源成了核威慑。**中国开源模型下载量占全球 41%，首次超过美国。阿里把旗舰级开源，智谱把 Ox Alpha 免费——不开源，连上牌桌的资格都没有。

对于开发者，这是好时代：几块钱让模型写本小说、设计一套厨房、审一份合同。对于大模型厂商，上半场比谁跑得快，下半场比谁活得久——筹码不是更炫的 Demo，是更极致的成本控制、更硬核的架构、更自主的算力底座。

## 九、过了门槛，争的是注意力

归根结底，Qwen 和智谱抢的，是比「性能第一」更关乎发展生存的东西。

能力过了「实用够用线」——编程、办公、岗位这些真实任务不再翻车——之后，除了少数把模型逼到 HLE 这类前沿题的重度用户，大多数人分不出 57 分和 52 分的差别。大家更在意的，是便宜、是快——前提是质量不塌。Qwen3.8-Flash 和 GLM-5.3-Flash 卡的就是这个位置：能力够用，价格和速度拉满。

用户、流量、影响力，本质都是同一件事——注意力。GPT 的价格和策略隔一阵就重置一次，一边拉新用户，一边抢注意力。很多东西和 AI 一样，价值不在自己手里，在别人愿意花多少注意力看你。谁能控制注意力，谁就能抓住重点。

争 SOTA 也一样——刷榜第一，本质是抢注意力。只是过了少数一两家争雄的年代，榜单轮流换人，大家早看麻了。下一次能重新引爆所有人注意力的，只剩一件事：突破到 AGI。

而且「性能」这个标的本身也不干净。它一半是真能力，一半是打榜和做秀——刷 benchmark 炒分数、发 PR 炒「最强」，用「强」抢注意力。还有一条更隐蔽的路：危言耸听。Fable 5 那阵，Anthropic 一边喊「Mythos 级、史上最强」，一边到国会要求立法限制——「强」和「危险」互相矛盾却能同时喊，说明都是手段，不是事实。而「危险」这副面具抢的不是流量，是规则制定权：让国会出手，等于给没赶上牌桌的对手设门槛。这比降价狠得多。

「牛来」了。它是技术狂飙和市场内卷的合力结果。方向只有一个：向前，向应用，向每一个真实的需求。

