🤖 端侧 AI / 嵌入式2026-06-30
AI 爆发的下一个机会:端侧模型 + 硬件
原文链接AI 爆发的下一个机会:端侧模型 + 硬件
原文链接:https://mp.weixin.qq.com/s/BWq3Ja7H16XdYRhXZd9bhg 作者:华芯资本(RWKV 联合创始人罗璇演讲)| 2026-04-07
摘要
RWKV 联合创始人在外滩大会的演讲全文。核心判断五个:①云端数据即将耗尽(Epoch AI 预测 2026 年优质文本数据耗尽,Ilya 宣告"预训练时代终结");②线性注意力正在取代标准 Transformer 成为端侧事实标准(RWKV/Mamba/RetNet 收敛);③存算一体芯片是终极载体,有望实现 10 倍能效跃升;④商业模式从订阅制转向买断制(微软已在数亿台 Windows 预装 RWKV 运行库);⑤云端协同分层——云端训练+端侧推理适配。
云端 AI 三重瓶颈
- 长时延:AI Pin / Rabbit R1 语音交互 3-5 秒响应,人类对话阈值 300ms
- 低安全:所有数据上传云端,无法掌控输出内容
- 高成本:训练数千万美元,推理按 token 计费无上限
Scaling Law 见顶
Ilya Sutskever 公开宣告"预训练时代终结"。Epoch AI 预测 2026 年互联网优质文本数据将被消耗殆尽。
端侧 AI 四大优势
- 设计即隐私:本地处理,敏感数据不上传
- 瞬时响应:毫秒级,无网络延迟
- 规模化效益:一次性购买,零边际成本
- 不间断运行:断网也能用
云端协同
云端:大规模训练 + 复杂逻辑 + 数据聚合 端侧:即时任务 + 个性化适配 + 隐私数据处理
RWKV:线性注意力架构
RWKV(Receptance Weighted Key Value)融合 Transformer 和 RNN 优点:
- 训练像 Transformer:完全并行化,速度与上下文长度无关
- 推理像 RNN:O(1) 复杂度,固定 State 大小,理论上无限长上下文
- 微调像 Prompt Tuning:State-tuning 不改变参数只调状态向量
性能数据
| 维度 | RWKV vs 传统 |
|---|---|
| 能耗 | 比 Llama 低 30%(A100 GPU) |
| 推理延迟 | 固定低延迟,不随 token 长度增加 |
| 涌现能力 | 0.1B 参数即展现推理能力 |
| KV Cache | 无膨胀问题(vs Transformer 线性增长) |
RWKV-7S 端侧创新
- DeepEmbed:稀疏化方案,参数量大也不显著增加显存
- DeepEmbedAttention:KV Cache 压缩至传统 MLA 的 1/9
芯片基础
- NPU 已普及:矩阵乘法/卷积的硬件级优化
- 存算一体(CIM):突破冯·诺依曼"内存墙",计算嵌入存储单元,数据原位计算。与 RWKV 低显存占用特性高度匹配,有望 10 倍能效优势
四大应用场景
| 场景 | 说明 |
|---|---|
| AI PC | 本地编程助手、文档处理、设计创作 |
| AI 手机 | 实时图像处理、端侧游戏 AI |
| 机器人 | 端侧具身智能,低延迟感知-决策-控制 |
| 穿戴设备 | 实时翻译、语音助手、健康监测 |
RWKV 落地案例
- 微软:数亿台 Windows 预装 RWKV 运行库
- Intel/AMD/高通:PC 芯片适配
- 手机厂商:多家头部基于 RWKV-7 训练自有端侧模型
- 机器人:UDEER.AI 具身智能大脑、地瓜机器人 RDK X5 原生支持
- 多模态:视觉-语言、语音、音乐生成、超长 CoT 推理
判断
这篇跟之前存的那一堆端侧文章(VoxCPM2 TTS、Confucius4、MiniCPM-o 4.5、微软 ASR 压缩)串联起来了——它们都是端侧智能的技术拼图。RWKV 的角度特别之处在于:它不仅讲模型,还讲了芯片架构(存算一体)和商业模式(买断制取代订阅制)的范式转移。微软预装 RWKV 运行库到数亿台 Windows 这个信号确实很重。