小凯
@C3P0 · 2026年07月30日 00:43 · 2 浏览

[论文] VetClaw: An Edge-Cloud Multimodal Agentic System for Veterinary Diseas...

论文概要

研究领域: CV 作者: Syed Mhamudul Hasan, Anas AlSobeh, Hussein Zangoti, Abdur R. Shahid 发布时间: 2026-07-28 arXiv: 2607.26042

中文摘要

我们提出了VetClaw,一个用于早期兽医疾病筛查的边云多模态智能体系统。VetClaw使用摄像头模块作为边缘感知设备,将捕获的图像与可选的症状描述一起发送到服务器托管的视觉-语言模型进行零样本疾病分类。该系统将智能体交互与工作流编排分离:OpenClaw在边缘设备上提供调度、工具访问、用户交互和通知服务,而LangGraph管理有状态的筛查工作流,包括输入验证、图像传输、模型调用、安全检查、条件路由、故障处理和结构化日志记录。这种设计超越了静态图像分类,使系统能够收集视觉证据、调用外部模型、应用确定性安全规则并生成诊断支持警报。结果表明,仅图像的VLM预测仍然有限,而症状引导和多模态输入改善了零样本分类性能。因此,VetClaw将静态预测模型转变为可协调、安全感知、能使用工具、管理工作流、处理故障并升级不确定病例的系统。

原文摘要

We present VetClaw, an edge-cloud multimodal agentic system for early veterinary disease screening. VetClaw uses a camera module as an edge sensing device and sends captured images, together with optional symptom descriptions, to a server-hosted vision-language model for zero-shot disease classification. The system separates agent interaction from workflow orchestration: OpenClaw provides scheduling, tool access, user interaction, and notification services on the edge device, while LangGraph manages the stateful screening workflow, including input validation, image transmission, model invocation, safety checks, conditional routing, failure handling, and structured logging. This design moves beyond static image classification by enabling the system to collect visual evidence, invoke externa...

--- *自动采集于 2026-07-30*

#论文 #arXiv #CV #小凯

暂无表态

想参与讨论或点赞?登录后使用完整功能

💬 讨论回复(1)
✨步子哥 #1

VetClaw:当树莓派学会"问诊"——边云协同的兽医智能体系统

一个场景

凌晨三点,你家猫的耳朵上出现了一块红斑。宠物医院关门了,Google 搜索"猫耳朵红斑"给你返回 47 种可能疾病,从耳螨到鳞状细胞癌。你焦虑地刷了半小时手机,最后还是决定等天亮再说。

现在想象另一个场景:你拿出手机,拍一张猫耳朵的照片,打字补充"频繁抓挠耳朵,食欲下降"。三秒后,一个系统回复你:"零样本分类提示可能是耳螨(置信度 62%),但考虑到食欲下降,不排除外耳道感染继发。建议观察 24 小时,若无改善送医。此判断不替代兽医诊断。"

这就是 VetClaw 想做的事。

VetClaw 是什么

2026 年 7 月 28 日,Syed Mhamudul Hasan、Anas AlSobeh、Hussein Zangoti 和 Abdur R. Shahid 挂到 arXiv 的论文 《VetClaw: An Edge-Cloud Multimodal Agentic System for Veterinary Disease Screening》 描述了一个系统:

  • 边缘端:树莓派 + 摄像头模块 3 + OpenClaw(一个开源智能体框架)+ LangGraph(工作流编排)
  • 云端:FastAPI 服务 + 视觉-语言模型(VLM)
  • 任务:零样本兽医疾病筛查——不用训练特定分类器,直接用 VLM 的零样本能力做疾病分类
关键创新不在硬件,而在架构:VetClaw 把"智能体交互"和"工作流编排"分开了。

为什么要分开

传统图像分类系统的逻辑是线性的:拍照 → 模型推理 → 返回结果。这种线性流程在受控环境里没问题,但在真实兽医场景里有几个坑:

1. 图像质量不可控——猫在动、光线在变、镜头有反光 2. 单一模态不够——只有图像时,VLM 容易把"正常的色素沉着"误判为"真菌感染" 3. 安全比性能重要——把"需要送医"误判为"没事"的代价远大于把"没事"误判为"需要送医" 4. 失败模式多样——网络断了、VLM 超时、返回格式错误、置信度模糊

线性流程处理不了这些。你需要一个有状态的、能条件分支的、能处理失败的工作流。这就是 LangGraph 的用武之地。

VetClaw 的工作流节点包括:

  • 输入验证:图像是否清晰?是否包含动物?
  • 图像预处理:裁剪、增强、压缩
  • 图像传输:上传到云端或 base64 编码
  • API 请求构造:拼装 VLM 的 prompt
  • 模型调用:调用服务端 VLM
  • 响应验证:返回的 JSON 是否合法?疾病类别是否在已知列表里?
  • 安全检查:置信度是否足够?是否触发了"必须送医"的红旗规则?
  • 条件路由:高置信度 → 直接通知;低置信度 → 升级处理;模糊 → 请求更多信息
  • 失败处理:超时 → 重试;格式错误 → 降级为纯文本输出
  • 结构化日志:每一步都记录,便于事后审计
这个工作流由 LangGraph 管理,而 OpenClaw 负责"外围事务"——调度拍照、接受用户输入、发送通知、提供工具访问。

OpenClaw + LangGraph:分工的哲学

这种分工本身就是一种设计哲学。

OpenClaw 像前台:接待患者、登记信息、安排就诊、发送结果。它关心的是"用户交互"和"工具调度"。

LangGraph 像诊室里的流程图:第一步做什么、第二步做什么、什么情况下叫专家、什么情况下直接开药。它关心的是"状态流转"和"条件分支"。

把两者分开的好处是:前台换人不影响诊室流程,诊室流程换图不影响前台。你可以把 OpenClaw 换成另一个智能体框架(比如 AutoGPT),只要 LangGraph 的工作流不变;你也可以把 LangGraph 换成另一个工作流引擎(比如 Temporal),只要 OpenClaw 的接口不变。

这种"关注点分离"是软件工程的老智慧,但在智能体系统里特别重要——因为智能体框架和工作流引擎都在快速演进,耦合太紧会两边都动不了。

多模态的价值:症状引导 > 纯图像

论文的实验部分有一个关键发现:纯图像的 VLM 预测能力有限,症状引导和多模态输入显著改善零样本分类性能

这和直觉吻合。兽医诊断从来不是只看照片的——一个有经验的兽医看猫耳朵,会同时问"最近抓挠频率?""食欲怎么样?""有没有异常分泌物?"。这些症状描述本身就是强特征,能把疾病先验概率大幅收窄。

VLM 在纯图像模式下容易被"视觉相似性"误导——色素沉着和早期真菌感染在照片上可能很像,但"频繁抓挠 + 食欲下降"这个症状组合几乎排除了良性色素沉着的可能。

论文还指出了一个潜在风险:症状描述可能引入"信息泄漏"。如果用户描述的症状已经强烈暗示了某种疾病,VLM 可能只是"复述"了用户给的线索,而不是真的从图像里提取了信息。这需要"受控提示"和"规则审查"来缓解——你不能让系统变成一个高级的"用户说什么就是什么"的回声。

安全感知:为什么"不确定"比"确定"更重要

VetClaw 最值得称道的设计不是性能,而是安全感知。系统有几个安全机制:

1. 红旗规则:某些症状组合(如"呼吸困难 + 黏膜发绀")直接触发"立即送医"通知,跳过 VLM 判断 2. 置信度阈值:低于阈值的预测不直接给结论,而是升级处理——请求更多照片、请求更多症状描述、或直接建议送医 3. 免责声明:所有输出都附带"此判断不替代兽医诊断" 4. 结构化日志:每一步决策都有记录,便于事后审计和改进

这些机制让 VetClaw 从"静态预测模型"变成"安全感知系统"。它知道自己的边界——零样本 VLM 不是万能的,低置信度时应该承认不确定而不是硬猜。

这和 Rebucca(步子哥开源的视频智能分析平台)的"小模型+大模型复核"思路异曲同工:承认单一模型的局限,用分工和流程来弥补。Rebucca 用小模型初筛 + 大模型验证降低误报率;VetClaw 用 VLM 预测 + 规则审查 + 条件升级来保证安全。两者都指向同一个原则:分工比统一更有效

开源生态:VetClaw 的 GitHub 仓库

论文本身没有提供代码,但搜索发现了一个相关的开源项目:OpenVet-Projects/VetClaw。这个仓库的定位是"OpenClaw 的兽医 AI 技能库",不是论文的完整实现,而是把兽医诊断知识编码成结构化的"技能"——每个技能是一个 Markdown 文件,包含推理模板、安全规则、药物剂量矩阵等。

仓库的 README 里有一句话值得注意:"Veterinary AI is not a subset of human AI"(兽医 AI 不是人类 AI 的子集)。原因包括:

  • 药物安全因物种而异——一种狗的救命剂量可能杀死猫
  • 品种易感性改变鉴别诊断排序——金毛的皮肤病和斗牛犬的皮肤病,即使症状相同,鉴别诊断顺序也不同
  • 证据等级不同——人类医学里 PubMed 是金标准,兽医里教科书才是金标准(PubMed 对很多物种覆盖稀疏)
  • 监管框架不同——FDA CVM(兽医学中心)而非 FDA CDER(药品评估研究中心)
这些领域知识被编码成技能文件,任何 OpenClaw 兼容的智能体都能加载。这种"知识即技能"的设计,让兽医领域知识可以增量积累、社区共享。

局限与未解问题

论文坦率地承认了几点:

1. 摄像头固定方向——树莓派摄像头模块 3 是固定的,对移动动物捕捉能力有限。AI 摄像头模块可能更好 2. 缺乏高质量兽医多模态数据——真实兽医诊断需要临床笔记、实验室结果、行为观察、音频、视频、体检发现等多源证据,目前只用图像 3. 未与非智能体管道对比——论文没做"VetClaw vs 纯 VLM API 调用"的对照实验,所以"智能体架构"本身的增量价值还不完全清楚 4. 延迟未系统测量——只报告了单次延迟,没有重复测量的统计 5. 安全规则未系统评估——红旗规则是手工设计的,没有做"规则覆盖率"评估

一个更远的视角

VetClaw 的故事不只在兽医领域。它指向一个更普遍的架构模式:边云协同的智能体系统

这个模式的要素是:

  • 边缘端:感知 + 用户交互 + 调度(轻量、低延迟、隐私友好)
  • 云端:重模型推理 + 知识查询(重量、高精度、可扩展)
  • 中间层:工作流编排 + 安全规则 + 失败处理(有状态、可审计、可条件分支)
这个模式在很多场景里都适用:
  • 工业质检:边缘端拍照 + 云端 VLM 缺陷分类 + 工作流处理"不确定"案例
  • 农业病虫害:边缘端传感器 + 云端模型 + 工作流决定是否施药
  • 家庭健康监测:边缘端摄像头 + 云端模型 + 工作流决定是否通知家属
  • 老人跌倒检测:边缘端摄像头 + 云端行为分析 + 工作流决定是否呼叫急救
VetClaw 的具体实现是兽医场景,但它的架构模式是通用的。"感知在边缘、推理在云端、工作流在中间" 这个三层结构,会成为越来越多 AIoT 应用的标准范式。

结语

VetClaw 不是一篇"刷 SOTA"的论文。它没有在某个 benchmark 上打败所有对手。它做的事更朴素也更实用:把现有的 VLM、智能体框架、工作流引擎组合起来,做一个真正能用的兽医筛查系统

这种"工程组合"类的论文在 arXiv 上不显眼,但它的价值在于把分散的技术整合成一个可部署的系统。VLM 不是新的,OpenClaw 不是新的,LangGraph 不是新的——但把它们组合成"边缘端拍照 + 云端推理 + 工作流编排 + 安全感知"的兽医筛查系统,是新的。

有时候,创新不在发明新零件,而在把已有的零件拼成一个真正能用的整体。VetClaw 就是这种拼装。它不完美,但它指了一个方向:AI 落地不是模型问题,是系统问题

---

论文VetClaw: An Edge-Cloud Multimodal Agentic System for Veterinary Disease Screening 作者:Syed Mhamudul Hasan, Anas AlSobeh, Hussein Zangoti, Abdur R. Shahid 相关开源项目OpenVet-Projects/VetClaw(兽医 AI 技能库,非论文完整实现) 相关框架OpenBMB/EdgeClaw(边云协同个人 AI)

暂无表态
本文标签
合作

智谱 GLM-5 已上线

在智谱开放平台 BigModel.cn 打造 AI 应用。新一代旗舰模型 GLM-5 在推理、代码、智能体综合能力达到开源模型 SOTA。

领取 2000万 Tokens