🔧 AI 知识库

ESP-Claw:乐鑫开源,把 Agent 塞进 ESP32

原文链接

ESP-Claw:乐鑫开源,把 Agent 塞进 ESP32

原文链接:https://mp.weixin.qq.com/s/oeRIbp0z9YoFEKEP90xTLg 来源:掘金 GitHub | 2026-04-27

摘要

乐鑫开源的 ESP-Claw 是一个运行在 ESP32 芯片上的 AI 智能体框架,核心理念是 Chat Coding——在 IM 里跟设备聊天,设备就能自己学会怎么干活。三层的处理架构(Lua 确定性规则 → LLM 动态决策 → 云端大模型)+ MCP 双身份(Server/Client)+ 本地记忆,让设备从"傻执行"升级到"感知→推理→决策→执行"完整闭环。项目地址:https://github.com/espressif/esp-claw


物联网的痛点

传统 IoT 设备的老毛病:能联网不能思考、能执行不能决策、能记录不能学习、高度依赖云端断网就变砖、控制方式 App/面板碎片化。

一句话:设备是"傻"的,只会按预设规则执行,不会根据实际情况做判断。


ESP-Claw 核心能力

1. Chat Coding:对话定义设备行为

传统流程:选芯片 → SDK → 写 C → 编译 → 刷固件 → 配网 → App → 控制

ESP-Claw:刷固件 → 连 Wi-Fi → 打开微信/飞书/Telegram → 跟设备聊天 → 搞定

例如对设备说"每天早上 8 点,如果温度超过 28 度就打开风扇,同时给我发条消息",设备自己理解意图、生成逻辑、执行。

2. 设备端智能闭环

Agent Runtime 直接下沉到 ESP32 芯片,本地完成感知→推理→决策→执行。超出本地算力自动上传云端模型处理,结果返回——云边协同。

3. 三层事件处理架构

层级机制响应速度适用场景
第一层Lua 确定性规则毫秒级报警联动、安全控制
第二层LLM 动态决策秒级场景分析、用户意图理解
第三层云端大模型十秒级复杂推理、图像识别

有匹配规则 → Lua 直接执行(断网也能跑);没匹配规则 → LLM 分析;超出本地能力 → 云端。灵活性和稳定性兼顾。

4. 本地记忆,隐私不上云

记忆全在本地:用户偏好、行为习惯、关键事件、自动学习(从历史事件发现规律主动建议自动化方案)。

摘要标签机制:平时只加载轻量标签目录,需要时精确召回对应记忆。记忆自动归并、淘汰与压缩。设备越用越聪明,数据不上云。


MCP 协议:设备成为 AI 原生对象

这是最强的部分——设备具备 MCP Server + MCP Client 双重身份:

  • MCP Server 侧:传感器读取、执行器控制封装为标准 MCP Tool,任何支持 MCP 的 Agent 直接调用(如 Claude Code 调开发板摄像头拍照识别硬件)
  • MCP Client 侧:主动调用网络上的 MCP Server 服务(高德地图查路况、飞书发提醒)

设备之间可以直接对话,不需要经过云端中转。 设备从被动的"执行端"变成了主动的"智能节点"。


实际场景

  • 智能安防:PIR 检测人 → 拍照 → 识别 → 入侵推送通知 + 照片;动物 → 静默记录事后汇总
  • 智能温控:记住"我喜欢 26 度",温度超 28 开风扇,发现习惯后主动建议自动化
  • 硬件开发辅助:Claude Code 调用摄像头拍照识别 PCB,编译进度实时显示在设备屏幕
  • 办公自动化:检测会议室有人但无人说话 → 自动关空调 + 调用飞书发提醒 + 高德查路况提前提醒出门

快速上手

支持芯片:ESP32-S3、ESP32-C5、ESP32-P4

两种方式

  1. 浏览器一键刷固件(零安装零编程)
  2. 源码编译:git cloneidf.py buildidf.py flash

配置:连接 Wi-Fi 后设备提供 Web 配置页面,IM 里跟设备聊天即可控制,支持自由切换模型供应商不依赖封闭生态。


项目架构四层

  1. 应用组装层:启动入口、网络配置、Web 配置页
  2. 能力层:IM 通信、MCP Client/Server、Lua 运行时、调度等
  3. 运行时核心层:核心上下文、能力注册、事件路由、记忆管理(claw_core / claw_cap / claw_event / claw_memory / claw_skill)
  4. 设备扩展层:显示屏、摄像头、音频、GPIO 等外设暴露给 Lua 和 Agent

写在后头

OpenClaw 是跑在 PC/服务器上的 AI 智能体网关。ESP-Claw 把这套能力延伸到了实体物理世界——把 Agent 塞进 ESP32,让设备自己能看、能想、能干。

这不是又一个"语音控制开关"玩具,是真正让 IoT 设备具备自主决策能力的基础设施。当聊天就能开发智能设备成为现实,IoT 开发门槛会被拉到多低?