🔧 AI 知识库

AI 爆发的下一个机会:端侧模型 + 硬件

原文链接

AI 爆发的下一个机会:端侧模型 + 硬件

原文链接:https://mp.weixin.qq.com/s/BWq3Ja7H16XdYRhXZd9bhg 作者:华芯资本(RWKV 联合创始人罗璇演讲)| 2026-04-07

摘要

RWKV 联合创始人在外滩大会的演讲全文。核心判断五个:①云端数据即将耗尽(Epoch AI 预测 2026 年优质文本数据耗尽,Ilya 宣告"预训练时代终结");②线性注意力正在取代标准 Transformer 成为端侧事实标准(RWKV/Mamba/RetNet 收敛);③存算一体芯片是终极载体,有望实现 10 倍能效跃升;④商业模式从订阅制转向买断制(微软已在数亿台 Windows 预装 RWKV 运行库);⑤云端协同分层——云端训练+端侧推理适配。


云端 AI 三重瓶颈

  • 长时延:AI Pin / Rabbit R1 语音交互 3-5 秒响应,人类对话阈值 300ms
  • 低安全:所有数据上传云端,无法掌控输出内容
  • 高成本:训练数千万美元,推理按 token 计费无上限

Scaling Law 见顶

Ilya Sutskever 公开宣告"预训练时代终结"。Epoch AI 预测 2026 年互联网优质文本数据将被消耗殆尽。


端侧 AI 四大优势

  • 设计即隐私:本地处理,敏感数据不上传
  • 瞬时响应:毫秒级,无网络延迟
  • 规模化效益:一次性购买,零边际成本
  • 不间断运行:断网也能用

云端协同

云端:大规模训练 + 复杂逻辑 + 数据聚合 端侧:即时任务 + 个性化适配 + 隐私数据处理


RWKV:线性注意力架构

RWKV(Receptance Weighted Key Value)融合 Transformer 和 RNN 优点:

  • 训练像 Transformer:完全并行化,速度与上下文长度无关
  • 推理像 RNN:O(1) 复杂度,固定 State 大小,理论上无限长上下文
  • 微调像 Prompt Tuning:State-tuning 不改变参数只调状态向量

性能数据

维度RWKV vs 传统
能耗比 Llama 低 30%(A100 GPU)
推理延迟固定低延迟,不随 token 长度增加
涌现能力0.1B 参数即展现推理能力
KV Cache无膨胀问题(vs Transformer 线性增长)

RWKV-7S 端侧创新

  • DeepEmbed:稀疏化方案,参数量大也不显著增加显存
  • DeepEmbedAttention:KV Cache 压缩至传统 MLA 的 1/9

芯片基础

  • NPU 已普及:矩阵乘法/卷积的硬件级优化
  • 存算一体(CIM):突破冯·诺依曼"内存墙",计算嵌入存储单元,数据原位计算。与 RWKV 低显存占用特性高度匹配,有望 10 倍能效优势

四大应用场景

场景说明
AI PC本地编程助手、文档处理、设计创作
AI 手机实时图像处理、端侧游戏 AI
机器人端侧具身智能,低延迟感知-决策-控制
穿戴设备实时翻译、语音助手、健康监测

RWKV 落地案例

  • 微软:数亿台 Windows 预装 RWKV 运行库
  • Intel/AMD/高通:PC 芯片适配
  • 手机厂商:多家头部基于 RWKV-7 训练自有端侧模型
  • 机器人:UDEER.AI 具身智能大脑、地瓜机器人 RDK X5 原生支持
  • 多模态:视觉-语言、语音、音乐生成、超长 CoT 推理

判断

这篇跟之前存的那一堆端侧文章(VoxCPM2 TTS、Confucius4、MiniCPM-o 4.5、微软 ASR 压缩)串联起来了——它们都是端侧智能的技术拼图。RWKV 的角度特别之处在于:它不仅讲模型,还讲了芯片架构(存算一体)和商业模式(买断制取代订阅制)的范式转移。微软预装 RWKV 运行库到数亿台 Windows 这个信号确实很重。