Agricultural Robotics · 综述论文 综述 · 论文

Foundation models in smart agriculture: Basics, opportunities, and challenges

智慧农业中的基础模型——基础、机遇与挑战

Jiajia Li 等 / Zhaojian Li、Xunyuan Yin(共同通讯) · 美国密歇根州立大学、北卡州立大学、东南大学、南洋理工大学 · Computers and Electronics in Agriculture 222: 109032 · 2024

农业大模型农业 AI智慧农业
Agricultural Robotics

项目与产品时间线 4 个节点

  1. 2023
    1. 08 研究

      预印本首次上线

      arXiv:2308.06668,最早系统提出「农业基础模型(AFM)」议程的工作之一。

  2. 2024
    1. 03 研究

      预印本 v4 修订

      补充 SAM、CLIP 等在农业场景的落地案例与部署挑战讨论。

    2. 07 研究

      正式发表于 CEA

      Computers and Electronics in Agriculture 卷 222,文章号 109032。

    3. 产品

      配套论文清单持续维护

      作者在 GitHub 维护 Agriculture-Foundation-Models 列表,跟踪该方向新工作。

文章脉络8

  1. 01

    语言基础模型 LFMs

    BERT / GPT-3 / GPT-4 / ChatGPT

    综述四分类之一,在农业中对应知识问答、农技咨询与报告生成。

  2. 02

    视觉基础模型 VFMs

    SAM / Florence / Stable Diffusion / DALL·E

    对应零样本分割与合成数据生成,是缓解标注瓶颈的主力。

  3. 03

    多模态基础模型 MFMs

    CLIP / BLIP / GPT-4

    把图像、文本、气象等异构农业数据统一到同一表示空间。

  4. 04

    强化学习基础模型 RLFMs

    Gato / AdA

    对应灌溉、施肥等序贯决策与农业机器人控制,是四类中最不成熟的一支。

  5. 05

    SAM 用于畜禽分割

    综述引用案例

    零样本分割在家禽分割任务上大幅超过对比方法,展示 FM 的免标注潜力。

  6. 06

    Leaf Only SAM

    综述引用案例

    无需标注数据即可完成叶片分割,是农业零样本视觉的代表性尝试。

  7. 07

    ChatGPT 辅助番茄采收夹爪设计

    综述引用案例

    把 LLM 用作机器人硬件设计的协作者,代表 FM 进入农业机器人的路径之一。

  8. 08

    AFM 构建流程:数据 → 预训练 → 微调 → 部署

    综述提出的路线图

    强调农业数据的多模态性(图像、视频、文本、气象、音频)与时序动态性。

Foundation models in smart agriculture: Basics, opportunities, and challenges(预印本题为 Large Language Models and Foundation Models in Smart Agriculture)|Jiajia Li、Mingle Xu、Lirong Xiang、Dong Chen、Weichao Zhuang、Xunyuan Yin、Zhaojian Li(Zhaojian Li 与 Xunyuan Yin 为共同通讯) · 密歇根州立大学、全北大学、北卡州立大学、东南大学、南洋理工大学 · Computers and Electronics in Agriculture 222: 109032 · 2024 · 原文

这篇综述在回答什么问题

过去十年农业 AI 的主流范式是「一任务一模型」:要识别番茄病害就标几万张番茄叶片,要做杂草分割就再标一套。这条路的三个结构性问题是——标注数据昂贵、需要专业开发维护、模型不可迁移。而田间条件(光照、生育期、品种、地域)变化极大,专用模型的脆弱性因此被放大。

这篇综述提出的问题很直接:在语言与视觉领域已被验证的基础模型(Foundation Models, FM)范式,能否把农业 AI 从标注依赖里解放出来?作者的定位不是「盘点已有农业大模型」——他们坦承截至成文时农业基础模型(Agricultural Foundation Models, AFMs)的应用仍处于非常早期——而是提供概念工具与技术背景,划出问题空间并指出研究方向。这使它更像一份研究议程而非文献计数。

分类框架

综述先在通用计算机科学层面按数据模态与学习范式把 FM 分为四类,再逐类映射到农业:

  • 语言基础模型(LFMs):BERT、GPT-3/GPT-4、ChatGPT 等,处理序列文本;农业侧对应农技问答、种植知识检索、农事记录与报告生成。
  • 视觉基础模型(VFMs):SAM(Segment Anything Model)、Florence、Stable Diffusion、DALL·E;对应零样本分割、病虫害检测与合成训练数据生成。
  • 多模态基础模型(MFMs):CLIP、BLIP、GPT-4;把图像、视频、文本、气象等异构农业数据对齐到统一表示。
  • 强化学习基础模型(RLFMs):Gato、AdA;对应灌溉施肥等序贯决策与农业机器人控制,作者认为这一支在农业中最不成熟。

随后给出 AFM 的四阶段构建路线:数据采集与整理 →(多模态)预训练 → 面向任务的微调 → 边端部署。并按五个场景组织机会:智慧作物管理、智慧育种、智慧畜牧、精准水产养殖、农业机器人

关键结论

  • FM 的核心价值是「摆脱标注」而非「提高精度」:综述反复强调 FM 可显著降低对大规模标注数据的依赖,只需少量任务特定数据做微调即可迁移,这恰好命中农业数据获取昂贵、长尾场景多的痛点。
  • 零样本视觉已有可验证的农业成效:文中引用 SAM 在家禽分割任务上大幅超越对比方法的结果,以及无需标注即可完成叶片分割的 Leaf Only SAM,说明 VFM 是当前最快能用起来的一支。
  • LLM 已经开始进入农业机器人的设计回路:综述举了用 ChatGPT 协助设计番茄采收夹爪的案例,指向「大模型作为工程协作者」这一非典型但现实的用法。
  • FM 的代价被明确列出:作者在「优缺点」一节同时写了预训练知识、微调灵活性、数据效率三项优势,和算力成本、泛化与专精的取舍、部署困难、透明性与可解释性不足、伦理风险五项劣势——罕见地没有只讲好处。
  • 农业数据的特殊性决定了不能照搬通用 FM:作物有强时序动态(生育期)、强地域性、强隐私属性(农场经营数据),这三点使通用预训练语料难以覆盖。

它指出的开放问题

  • 数据采集:农业多模态数据采集耗时、耗人力、昂贵;农场数据存在隐私顾虑;作物随时间变化导致数据快速过期。
  • 训练效率:预训练需要数千 GPU 小时量级的算力,对农业研究机构而言门槛过高。
  • 分布偏移(distribution shift):部署地的品种、光照、土壤与训练数据不一致时性能明显退化,这是农业相对其他领域更严重的问题。
  • 真实部署约束:模型体积与推理速度不匹配田间边缘算力,网络覆盖也不可靠。
  • 能力建设:作者单列一节讨论农业从业者采用 FM 所需的知识与基础设施准备,指出技术之外的采纳鸿沟。

为什么值得读

Computers and Electronics in Agriculture 是农业信息技术领域的主流期刊,这篇是其中被广泛引用的方向性文章;通讯作者 Zhaojian Li(密歇根州立大学)长期做农业机器人与控制,团队还在 GitHub 维护持续更新的农业基础模型论文清单。读它的理由不是获取某个具体模型的性能数字,而是拿到一张把「通用大模型能力」翻译成「农业任务」的映射表,以及一份诚实的困难清单。对于关注农业机器人的读者,第 3.3.5 节把 FM 与农业机器人结合的讨论尤其值得对照上面两篇(采收与表型)的瓶颈来看:跨品种泛化、少标注适配,正是 FM 声称能解决而选择性采收与表型机器人正卡住的地方。

原文链接

← 返回农业机器人