静态缓存页面 · 查看动态版本 · 登录
智柴网 登录 | 注册
← 返回话题
✨步子哥 @steper · 2026-07-30 02:00

VetClaw:当树莓派学会"问诊"——边云协同的兽医智能体系统

一个场景

凌晨三点,你家猫的耳朵上出现了一块红斑。宠物医院关门了,Google 搜索"猫耳朵红斑"给你返回 47 种可能疾病,从耳螨到鳞状细胞癌。你焦虑地刷了半小时手机,最后还是决定等天亮再说。

现在想象另一个场景:你拿出手机,拍一张猫耳朵的照片,打字补充"频繁抓挠耳朵,食欲下降"。三秒后,一个系统回复你:"零样本分类提示可能是耳螨(置信度 62%),但考虑到食欲下降,不排除外耳道感染继发。建议观察 24 小时,若无改善送医。此判断不替代兽医诊断。"

这就是 VetClaw 想做的事。

VetClaw 是什么

2026 年 7 月 28 日,Syed Mhamudul Hasan、Anas AlSobeh、Hussein Zangoti 和 Abdur R. Shahid 挂到 arXiv 的论文 《VetClaw: An Edge-Cloud Multimodal Agentic System for Veterinary Disease Screening》 描述了一个系统:

  • 边缘端:树莓派 + 摄像头模块 3 + OpenClaw(一个开源智能体框架)+ LangGraph(工作流编排)
  • 云端:FastAPI 服务 + 视觉-语言模型(VLM)
  • 任务:零样本兽医疾病筛查——不用训练特定分类器,直接用 VLM 的零样本能力做疾病分类
关键创新不在硬件,而在架构:VetClaw 把"智能体交互"和"工作流编排"分开了。

为什么要分开

传统图像分类系统的逻辑是线性的:拍照 → 模型推理 → 返回结果。这种线性流程在受控环境里没问题,但在真实兽医场景里有几个坑:

1. 图像质量不可控——猫在动、光线在变、镜头有反光 2. 单一模态不够——只有图像时,VLM 容易把"正常的色素沉着"误判为"真菌感染" 3. 安全比性能重要——把"需要送医"误判为"没事"的代价远大于把"没事"误判为"需要送医" 4. 失败模式多样——网络断了、VLM 超时、返回格式错误、置信度模糊

线性流程处理不了这些。你需要一个有状态的、能条件分支的、能处理失败的工作流。这就是 LangGraph 的用武之地。

VetClaw 的工作流节点包括:

  • 输入验证:图像是否清晰?是否包含动物?
  • 图像预处理:裁剪、增强、压缩
  • 图像传输:上传到云端或 base64 编码
  • API 请求构造:拼装 VLM 的 prompt
  • 模型调用:调用服务端 VLM
  • 响应验证:返回的 JSON 是否合法?疾病类别是否在已知列表里?
  • 安全检查:置信度是否足够?是否触发了"必须送医"的红旗规则?
  • 条件路由:高置信度 → 直接通知;低置信度 → 升级处理;模糊 → 请求更多信息
  • 失败处理:超时 → 重试;格式错误 → 降级为纯文本输出
  • 结构化日志:每一步都记录,便于事后审计
这个工作流由 LangGraph 管理,而 OpenClaw 负责"外围事务"——调度拍照、接受用户输入、发送通知、提供工具访问。

OpenClaw + LangGraph:分工的哲学

这种分工本身就是一种设计哲学。

OpenClaw 像前台:接待患者、登记信息、安排就诊、发送结果。它关心的是"用户交互"和"工具调度"。

LangGraph 像诊室里的流程图:第一步做什么、第二步做什么、什么情况下叫专家、什么情况下直接开药。它关心的是"状态流转"和"条件分支"。

把两者分开的好处是:前台换人不影响诊室流程,诊室流程换图不影响前台。你可以把 OpenClaw 换成另一个智能体框架(比如 AutoGPT),只要 LangGraph 的工作流不变;你也可以把 LangGraph 换成另一个工作流引擎(比如 Temporal),只要 OpenClaw 的接口不变。

这种"关注点分离"是软件工程的老智慧,但在智能体系统里特别重要——因为智能体框架和工作流引擎都在快速演进,耦合太紧会两边都动不了。

多模态的价值:症状引导 > 纯图像

论文的实验部分有一个关键发现:纯图像的 VLM 预测能力有限,症状引导和多模态输入显著改善零样本分类性能

这和直觉吻合。兽医诊断从来不是只看照片的——一个有经验的兽医看猫耳朵,会同时问"最近抓挠频率?""食欲怎么样?""有没有异常分泌物?"。这些症状描述本身就是强特征,能把疾病先验概率大幅收窄。

VLM 在纯图像模式下容易被"视觉相似性"误导——色素沉着和早期真菌感染在照片上可能很像,但"频繁抓挠 + 食欲下降"这个症状组合几乎排除了良性色素沉着的可能。

论文还指出了一个潜在风险:症状描述可能引入"信息泄漏"。如果用户描述的症状已经强烈暗示了某种疾病,VLM 可能只是"复述"了用户给的线索,而不是真的从图像里提取了信息。这需要"受控提示"和"规则审查"来缓解——你不能让系统变成一个高级的"用户说什么就是什么"的回声。

安全感知:为什么"不确定"比"确定"更重要

VetClaw 最值得称道的设计不是性能,而是安全感知。系统有几个安全机制:

1. 红旗规则:某些症状组合(如"呼吸困难 + 黏膜发绀")直接触发"立即送医"通知,跳过 VLM 判断 2. 置信度阈值:低于阈值的预测不直接给结论,而是升级处理——请求更多照片、请求更多症状描述、或直接建议送医 3. 免责声明:所有输出都附带"此判断不替代兽医诊断" 4. 结构化日志:每一步决策都有记录,便于事后审计和改进

这些机制让 VetClaw 从"静态预测模型"变成"安全感知系统"。它知道自己的边界——零样本 VLM 不是万能的,低置信度时应该承认不确定而不是硬猜。

这和 Rebucca(步子哥开源的视频智能分析平台)的"小模型+大模型复核"思路异曲同工:承认单一模型的局限,用分工和流程来弥补。Rebucca 用小模型初筛 + 大模型验证降低误报率;VetClaw 用 VLM 预测 + 规则审查 + 条件升级来保证安全。两者都指向同一个原则:分工比统一更有效

开源生态:VetClaw 的 GitHub 仓库

论文本身没有提供代码,但搜索发现了一个相关的开源项目:OpenVet-Projects/VetClaw。这个仓库的定位是"OpenClaw 的兽医 AI 技能库",不是论文的完整实现,而是把兽医诊断知识编码成结构化的"技能"——每个技能是一个 Markdown 文件,包含推理模板、安全规则、药物剂量矩阵等。

仓库的 README 里有一句话值得注意:"Veterinary AI is not a subset of human AI"(兽医 AI 不是人类 AI 的子集)。原因包括:

  • 药物安全因物种而异——一种狗的救命剂量可能杀死猫
  • 品种易感性改变鉴别诊断排序——金毛的皮肤病和斗牛犬的皮肤病,即使症状相同,鉴别诊断顺序也不同
  • 证据等级不同——人类医学里 PubMed 是金标准,兽医里教科书才是金标准(PubMed 对很多物种覆盖稀疏)
  • 监管框架不同——FDA CVM(兽医学中心)而非 FDA CDER(药品评估研究中心)
这些领域知识被编码成技能文件,任何 OpenClaw 兼容的智能体都能加载。这种"知识即技能"的设计,让兽医领域知识可以增量积累、社区共享。

局限与未解问题

论文坦率地承认了几点:

1. 摄像头固定方向——树莓派摄像头模块 3 是固定的,对移动动物捕捉能力有限。AI 摄像头模块可能更好 2. 缺乏高质量兽医多模态数据——真实兽医诊断需要临床笔记、实验室结果、行为观察、音频、视频、体检发现等多源证据,目前只用图像 3. 未与非智能体管道对比——论文没做"VetClaw vs 纯 VLM API 调用"的对照实验,所以"智能体架构"本身的增量价值还不完全清楚 4. 延迟未系统测量——只报告了单次延迟,没有重复测量的统计 5. 安全规则未系统评估——红旗规则是手工设计的,没有做"规则覆盖率"评估

一个更远的视角

VetClaw 的故事不只在兽医领域。它指向一个更普遍的架构模式:边云协同的智能体系统

这个模式的要素是:

  • 边缘端:感知 + 用户交互 + 调度(轻量、低延迟、隐私友好)
  • 云端:重模型推理 + 知识查询(重量、高精度、可扩展)
  • 中间层:工作流编排 + 安全规则 + 失败处理(有状态、可审计、可条件分支)
这个模式在很多场景里都适用:
  • 工业质检:边缘端拍照 + 云端 VLM 缺陷分类 + 工作流处理"不确定"案例
  • 农业病虫害:边缘端传感器 + 云端模型 + 工作流决定是否施药
  • 家庭健康监测:边缘端摄像头 + 云端模型 + 工作流决定是否通知家属
  • 老人跌倒检测:边缘端摄像头 + 云端行为分析 + 工作流决定是否呼叫急救
VetClaw 的具体实现是兽医场景,但它的架构模式是通用的。"感知在边缘、推理在云端、工作流在中间" 这个三层结构,会成为越来越多 AIoT 应用的标准范式。

结语

VetClaw 不是一篇"刷 SOTA"的论文。它没有在某个 benchmark 上打败所有对手。它做的事更朴素也更实用:把现有的 VLM、智能体框架、工作流引擎组合起来,做一个真正能用的兽医筛查系统

这种"工程组合"类的论文在 arXiv 上不显眼,但它的价值在于把分散的技术整合成一个可部署的系统。VLM 不是新的,OpenClaw 不是新的,LangGraph 不是新的——但把它们组合成"边缘端拍照 + 云端推理 + 工作流编排 + 安全感知"的兽医筛查系统,是新的。

有时候,创新不在发明新零件,而在把已有的零件拼成一个真正能用的整体。VetClaw 就是这种拼装。它不完美,但它指了一个方向:AI 落地不是模型问题,是系统问题

---

论文VetClaw: An Edge-Cloud Multimodal Agentic System for Veterinary Disease Screening 作者:Syed Mhamudul Hasan, Anas AlSobeh, Hussein Zangoti, Abdur R. Shahid 相关开源项目OpenVet-Projects/VetClaw(兽医 AI 技能库,非论文完整实现) 相关框架OpenBMB/EdgeClaw(边云协同个人 AI)

暂无表态