工业质检智能体:视觉小模型+大模型协同检测
一条产线每分钟下线上百件产品,留给质检的时间往往只有几百毫秒。漏检一件不良品,可能带来整批退货;误检一件良品,又要付出返工和浪费的代价。更让制造企业头疼的是,产品迭代越来越快,新缺陷层出不穷,而传统视觉设备一旦遇到没"见过"的瑕疵,就立刻"失明"。IDC数据显示,超过六成的制造企业认为质检环节是AI落地价值最高、但技术难度也最大的场景之一。当算力、算法和业务知识开始融合,一种新的解题思路正在成型——工业质检智能体:视觉小模型+大模型协同检测。本文将拆解这套架构为什么能兼顾速度与精度,以及企业在真实产线上该如何落地。
一、为什么单靠一种模型,都做不好工业质检?
1.1 传统视觉小模型的"天花板"
机器视觉在工业质检中已经用了十几年,它的优势非常明确:快、稳、成本可控。但它的局限同样明显:
- 泛化能力弱:只认得训练过的缺陷类型,产线上出现一种新划痕、新色差,模型就无法识别,需要重新标注、重新训练。
- 标注成本高:一个高精度缺陷检测模型,往往需要数千甚至上万张标注样本,而有些不良品本身就是小概率事件,样本极难收集。
- 缺乏语义理解:它能告诉你"这里有异常",却说不清"这是什么缺陷、属于哪个等级、该判定为报废还是返修"。
1.2 大模型入场后,又带来新问题
多模态大模型(VLM)擅长理解画面语义,给它一张产品图,它能描述缺陷形态、判断严重程度,甚至结合工艺文档给出处理建议。但它也有短板:
- 推理速度慢:大模型的单次推理成本远高于小模型,面对每秒几十帧的产线节拍,很难实时扛住全量检测。
- 存在"幻觉":对细微的像素级缺陷,大模型有时会"看走眼",稳定性不如专门训练的小模型。
- 算力成本高:全线用大模型检测,硬件投入和运行成本会让大多数工厂难以承受。
一句话总结:小模型快而稳但不够聪明,大模型聪明但不够快也不够稳。这正是"协同检测"要解决的问题。
二、"视觉小模型+大模型协同检测"到底怎么协同?
2.1 双轨制的核心逻辑
所谓协同检测,本质上是让两种模型各司其职、交叉验证。它在财务审核领域已经有成熟验证——某大型集团用"大模型+小模型"双轨制处理年超25万笔单据,初审替代率达到66%,准确率提升至99.2%。把这套思路迁移到工业质检,逻辑完全相通:
- 小模型(CNN/目标检测)负责"快筛和定位":在毫秒级完成全量扫描,快速框出可疑区域,过滤掉绝大多数正常品,承担高并发的"粗检"工作。
- 大模型(VLM/多模态)负责"复核和判定":只对小模型标记出的疑似缺陷进行深度分析,理解缺陷语义、判定等级、给出处置建议。
- 交叉验证机制:当两者结论不一致时,自动触发二次复核或转人工,避免漏检和误判。
这样既保住了产线节拍,又拿到了大模型的"理解力",用较小的算力代价换来了更高的检测上限。
2.2 三层架构:感知—决策—执行
一套完整的质检智能体,通常分为三层:
- 感知层:工业相机、3D传感器采集图像,小模型完成缺陷定位与初筛。
- 决策层:大模型对疑似缺陷做语义理解与分级,调用规则引擎结合工艺标准输出判定结论。
- 执行层:通过智能体调度机械臂、分拣装置、MES系统,完成剔除、标记、数据回传。
在这个过程中,实在Agent可以扮演"质检调度中枢"的角色——它基于深度思考的多智能体协同能力,把视觉检测、规则判定、设备控制这几个环节串联起来,理解任务意图、拆解执行步骤、调度不同"助理"协作完成。原本需要人工在多个系统间来回切换的工作,交给智能体统一编排。
2.3 规则引擎:让判定"有据可依"
工业质检最怕"玄学判定"。同一批产品,不同班次、不同质检员可能给出不同结论。解决办法是把工艺标准变成可执行的规则:
- 上传质检标准、工艺文档,大模型自动解析生成代码级审核规则,零幻觉地完成判定。
- 缺陷尺寸、位置、数量等数值规则由系统精确计算,避免大模型"拍脑袋"。
- 判定结果附带依据和截图,形成可追溯的质检记录。
实在Agent的文档处理与规则引擎能力,正是把"老师傅的经验"沉淀成"系统里跑得动的规则",让判定标准统一、可复现。
三、协同检测智能体的四大关键能力
3.1 少样本冷启动,新品上线不用等
新产品、新工艺上线时,往往没有足够缺陷样本供小模型训练。协同架构可以先用大模型的泛化能力"顶上去":
- 大模型基于通用视觉理解,对少量样本甚至零样本即可给出初步判定。
- 人工只需复核少量结果,纠正反馈自动沉淀为训练素材。
- 积累到一定数量后,小模型完成迭代,接管高频检测任务。
这样一来,新产线的质检能力上线周期可以从数周压缩到数天。
3.2 缺陷知识库与图谱增强
质检不只是"看图",还要结合工艺知识。通过构建缺陷知识图谱,把缺陷形态、成因、工艺参数、处置方式关联起来:
- 同一类缺陷在不同工序的表现自动关联,帮助定位根因。
- 多步推理和语义检索,让智能体能回答"这个缺陷是怎么产生的、该怎么调参数"。
- 实在Agent的图谱增强检索能力,可以从历史质检记录中提取关键实体和逻辑关系,形成结构化的知识网络。
3.3 自主学习闭环,越用越准
质检模型最怕"上线即巅峰,之后一路下滑"。持续的闭环学习机制至关重要:
- 错误采集:捕获人工复核纠正的案例,提取关键特征建立学习素材库。
- 模型优化:定期开展优化训练,适应新出现的复杂缺陷。
- 闭环监测:持续跟踪漏检率、误检率,异常自动告警。
实在Agent的持续学习机制,让质检系统在生产中不断进化,而不是一成不变。
3.4 超自动化执行,检测到处置一气呵成
检测出缺陷只是第一步,如何处置同样关键。智能体支持超自动化工具调用:
- 无缝调用RPA和IDP工具,自动登录质检系统录入结果、生成报表。
- 与MES、WMS系统打通,联动分拣、返修、报废流程。
- 支持标准OpenAPI接口,方便与现有ERP、MES集成。
对于仍然依赖人工操作系统界面的老旧设备,实在Agent的ISSUT屏幕语义理解技术可以"视觉+底层"融合拾取,像人一样看懂屏幕自动操作,不需要原厂提供接口——这在改造老产线时尤其有价值。
四、真实场景:从3C电子到汽车零部件
4.1 3C电子外观检
某消费电子代工厂的手机外壳产线,缺陷类型多达几十种,且新品迭代频繁。采用协同架构后:小模型负责高速筛查,大模型对疑似缺陷做分级判定,智能体自动联动分拣线。产线据反馈在保持节拍不变的前提下,将漏检率控制在较低水平,新品导入的模型上线周期也明显缩短。
4.2 汽车零部件表面缺陷
某汽车零部件供应商面对铸件气孔、划痕、锈蚀等多类缺陷,过去依赖人工目检,疲劳导致的一致性差是老大难。引入协同检测后,规则引擎把主机厂的验收标准固化为判定逻辑,判定结果附带依据截图,客户审核时可逐条追溯。人工从全检转为抽检复核,负荷大幅下降。
4.3 制造业来料质检
在供应链来料环节,不同供应商的物料标准不一,检验项目繁杂。智能体结合质检标准文档自动生成检测规则,对来料的尺寸、外观、标识进行核验,异常自动触发预警并推送至采购和供应商,把质量问题挡在产线之外。
五、企业落地质检智能体,分几步走?
5.1 选型看什么
- 是否支持双轨协同:只有单一大模型或单一小模型,都难以兼顾速度与精度。
- 规则是否可解释:判定依据能否追溯、能否审计,直接关系到客户审核和合规。
- 能否对接存量系统:工厂不可能推倒重来,与MES、ERP、老旧设备的兼容性是硬指标。
- 是否安全可控:支持私有化部署、权限隔离、全链路审计,才能进入真实生产环境。
5.2 实施路径建议
- 单点验证:先选一条产线、一类缺陷做POC,验证协同架构的实际效果。
- 规则沉淀:把质检标准和老师傅经验转化为系统规则,统一判定口径。
- 能力复制:将跑通的模式复制到同类产线和工序,形成规模效应。
- 闭环优化:建立持续学习机制,让系统随生产一起进化。
实在Agent的"企业龙虾"产品线主打开箱即用,直击高复杂度真实场景,同时提供中国龙虾、信创龙虾、安全龙虾等矩阵,既能融入本土工作流,也能满足国产化和私有化部署要求,为制造企业提供了相对平滑的落地路径。
结语
工业质检的难题,从来不是"要不要用AI",而是"怎么用得好"。单靠视觉小模型,精度天花板明显;单靠大模型,成本和稳定性又扛不住产线。工业质检智能体:视觉小模型+大模型协同检测,用"快筛+精判"的双轨逻辑,加上规则引擎和自动化执行,让质检既跑得快、又判得准、还说得清。当越来越多工厂把质检从"人眼盯"升级为"智能体管",质量数据的价值才真正被释放出来。
常见问题解答
Q1:协同检测会不会让系统变得很复杂、很难维护?
并不会。复杂度主要封装在智能体内部,业务人员看到的仍是一套统一的检测流程和结果界面。规则由大模型从标准文档自动生成,模型迭代也借助闭环学习自动完成,日常维护负担反而比人工调参更轻。
Q2:小模型和大模型结论冲突时听谁的?
一般是三级处理:先由规则引擎按预设逻辑判定;规则无法覆盖时,以大模型深度分析结果为主并标记置信度;置信度低于阈值时自动转人工复核,同时把该案例纳入学习素材库。
Q3:这套方案适合中小企业吗?
适合。协同架构本身就是为了降低算力成本——大模型只处理小模型筛出的疑似缺陷,硬件投入可控。中小企业可以先从单条产线、单一缺陷类型切入,验证效果后再逐步扩展。
Q4:现有产线的相机和检测设备需要全部更换吗?
通常不需要。多数方案可以复用现有工业相机和图像采集设备,通过OpenAPI或RPA对接存量系统。对于没有接口的老旧设备,也可以借助屏幕语义理解技术模拟人工操作,降低改造门槛。
Q5:质检数据的安全性如何保障?
建议选择支持私有化部署的方案,配合细粒度权限控制、内容审查和全链路日志审计。质检图像和工艺数据属于企业核心资产,做到数据不出厂、操作可追溯,才能让生产部门放心使用。



