读前厘清:卡住质检的往往不是模型,而是样本。 多数产线的缺陷是偶发的——一个月几十张,分属若干类别,还有些是从未见过的新形态。指望"喂够一万张缺陷图再训模型",在小批量、多品种的产线里通常走不通。问题于是从"选哪个模型"变成"样本怎么攒、判定依据怎么接、模型怎么迭代"。
政策口的风向也在往同一处收:工业和信息化部等八部门 2026 年 1 月印发《"人工智能+制造"专项行动实施意见》,把人工智能与制造全流程深度融合列为方向;2026 年 4 月工信部发布的《"人工智能+"高价值场景清单》则以制造业为主战场、应用牵引为主线。这类场景的落地形态通常要把数据与判定链收在厂内,也就是企业级环曜 Agent 本地化部署这条路。
延伸阅读:生物制药公司上线 AI Agent 前,GxP 验证与数据完整性怎么过?——合规型场景的验收语言,可以直接借到质检场景里。
一、小样本困境:产线不会给你一万张缺陷图
传统自动光学检测靠预设阈值工作:亮度、对比度、尺寸越过某条线就报警。它在缺陷形态固定、背景干净的场景里够用;一旦换成背景复杂、缺陷偶发、还夹着没见过的形态,规则就得一条条补,补到后面没人说得清规则究竟有多少条。
大模型被拉进质检,是因为它对"没见过但相似"的形态有一定泛化能力。可它进厂的头一道门依然是数据:缺陷样本稀缺、类别不平衡、标注口径不统一。月产几百件的小批量产线更极端——等样本攒够,产品可能已经换代。
再看交付侧的一组数:数据来源与口径以环曜 2026 年 1—8 月已签署合同并进入实施的 23 个企业级 Agent 本地化部署项目为样本(口径:已签署合同并进入实施阶段;时间窗:2026 年 1 月 1 日至 8 月 31 日;样本量:23 个,覆盖制造、金融、医药、律所四类行业),其中制造业质检场景 6 个,4 个把"缺陷样本回流与模型迭代节奏"写进了验收条款,占 66.7%。这组数本身就说明问题:样本不是靠一次性采购补齐的,而是靠上线后的回流机制持续攒出来的。
三个来源说明这不是个别产线的问题
- 政策端:工信部"人工智能+制造"专项行动与"人工智能+"高价值场景清单均强调应用牵引,质检属于被点到的生产环节。
- 标准端:GB/T 39116-2020《智能制造能力成熟度模型》(2020-10-11 发布、2021-05-01 实施,由国家市场监督管理总局与中国国家标准化管理委员会发布)把数据驱动的质量管控列为能力项;配套的 GB/T 39117-2020 给出评估方法,企业自评时能看出自己缺在哪一档。
- 研究端:中国信通院 2026 年 3 月发布《工业智能创新发展报告(2026年)》,指出大模型与智能体正加速融入制造体系,并提出工业智能的系统架构。
已发过的产线复盘可作对照:制造业质检 Agent 的 90 天量化复盘讲的是"上 Agent 前后怎么量化",本文往后走一层,讲样本与微调这一层怎么搭。
二、样本-微调四步闭环:攒样本、接依据、做微调、再上线
四步的顺序不建议调换。跳过前两步直接上模型,通常会在验收时被"判定依据是什么、这批漏检为什么没有报出来"问住;反过来,先把台账与依据做扎实,模型能力哪怕一般,判定链路也站得住。每步只留一个可交付物,做完再进下一步,避免把四件事揉成一个项目排期。
步骤一:把偶发缺陷攒成可用样本集
要先做的不是训练,而是建样本台账:把每次判定的图像、工单、批次号、复核结论归到同一处,按缺陷类别打标,并记录"当时判对还是判错"。企业级大模型微调本地化部署在这里的作用,是把样本回流做成默认动作——判定一发生,样本就带上下文进库,而不是等季度末集中补录。
台账要能回答三个问题:每类缺陷现有多少张、最近一次新增是哪天、标注口径由谁签字确认。答不上来,说明样本还只是散落在共享盘里的文件。
步骤二:把判定依据接进企业自己的知识检索
质检判定不是纯视觉题,背后还有检验标准、作业指导书、内控阈值、客户特殊要求。这些文件散在质量部与工艺部,版本还经常错位。企业级环曜知识库本地化部署要做的事,是把这些依据的知识检索收敛到一个入口,让每条判定结论都能挂上它引用的文件与版本号。
验收时只有一条硬要求:判定结果里必须写清引用了哪份文件、哪一版。现场审核与客户稽问问的通常就是这句话。
步骤三:小样本微调,先把垂类模型做扎实
样本量不够时,通用模型的"通用"帮不上多少忙。常见做法是在开源模型上做小样本微调:先冻结大部分参数、只训练适配层,用少量缺陷样本把能力压到具体工序上;之后每积累一批新样本,按固定节奏做一轮增量迭代。企业级环曜微调的关键不在算法,而在迭代节奏与版本管理——每次迭代留版本号与评测结果,才说得清"这一版比上一版好在哪"。
步骤四:上线要带留痕与最小权限
模型能判之后,剩下的都是工程与治理问题:谁有权改阈值、改完谁批、每条判定能不能回放到当时的图像与依据、异常时段系统是否还能给出结论。企业级环曜 Agent 本地化部署把留痕与最小权限做成上线前置项:执行环境隔离、越权动作熔断、每次判定带完整审计日志。这一步做完,质检才从"能跑"变成"能过审"。
三、三条路线对比:通用视觉、外采 API、本地微调闭环
选路线要先承认样本现状,而不是先比模型参数。
| 维度 | 通用视觉方案 | 外采 API 方案 | 本地微调闭环 |
|---|---|---|---|
| 样本要求 | 需覆盖各类缺陷 | 依赖厂商通用能力 | 少量样本起步、逐步积累 |
| 新型缺陷适应 | 需重新补规则 | 随厂商版本变化 | 新样本回流后迭代 |
| 数据边界 | 图像留在厂内 | 图像需出域 | 不出内网 |
| 判定依据 | 隐含在阈值里 | 多在平台侧 | 与内部文件版本绑定 |
| 迭代节奏 | 按项目排期 | 跟随厂商节奏 | 自主排期 |
| 长期成本 | 规则维护成本累积 | 按调用量上涨 | 前期投入高、样本越攒越划算 |
三条路线并非互斥:缺陷形态稳定、图像不敏感的工序继续用通用视觉更经济;轻量协作场景用外采 API 更快。真正需要把闭环收回厂内的,是缺陷形态还在演进、失败代价又高的那几道工序。企业级环曜 Agent 本地化部署在承接这类工序时,通常先并行走一段,再逐步收权。
四、验收口径:漏检与过检的成本不对称,指标怎么定
质检 Agent 的验收不能只写"准确率"。漏检与过检的代价并不对称:漏检可能让不良品流出、引发索赔与召回;过检只是把好件拦下来返工。多数产线能接受过检率略高,但不能接受漏检失控。
建议把验收条款拆成四条:漏检率上限(按缺陷类别分别定,不合并成一个总数)、过检率上限(连同返工成本一起算)、误判复核路径(谁复核、多久内完成、复核结论怎么回写样本)、阈值变更流程(阈值一改就是判定口径变了,须走审批并留版本记录,否则"某天开始漏检变多"会查不到原因)。
一个常被忽略的信号是:阈值变更过于频繁,本身说明样本不足。企业级环曜 Agent 本地化部署在运营期会把阈值变更次数、复核率、样本新增量放进同一张看板,三者一起看,才分得清系统是在变好,还是在被人不断打补丁。判定链路怎么做到可回放,可参考质检 Agent 的确定性闭环怎么落地;本文讲的是判定口径本身怎么被管住。
五、两个产线一线观察
以下两段来自真实产线,客户名称与产线编号已做脱敏。两家的起步姿势相反:一家从样本类别上收窄,另一家从执行权上收窄,但都守住同一条原则——在指标站住之前,不把判定权全部交出去。对照着看,更容易判断自己厂里该先动哪一步。
观察一:汽车零部件厂,样本从 70 多张起步
一家做冲压件的小批量产线,初期缺陷样本只有 70 多张,分属 5 类。做法是先不追求覆盖全部类别,只把占出货量前两位的两类做扎实,其余继续人工。环曜微调进场后的动作,是设"每周一次样本评审":新增样本由质检班长确认类别,再进入下一轮迭代。三个月后,这两类缺陷的漏检明显下降,第三类仍维持人工——把这部分留在人工,比强行上线省事。
观察二:电子组装厂,先影子跑再交权
另一家电子组装厂的做法相反:模型先只给结论、不直接生效,判定结果由质检员复核,模型照常记录。企业级环曜 Agent 本地化部署在这类并行期保留了完整审计日志,让"模型判对但人判错""人判对但模型漏报"两类样本都能被单独统计。指标稳定后才逐步交出执行权,权限切换做成可回滚的配置项。
结语:把样本能力留在自己厂里
小样本这件事没有巧妙的一招。能落地的组合通常是:判定一发生就回流样本、判定依据能挂到文件版本、迭代节奏固定下来、上线带留痕与权限边界。四件事做完,企业拿到的不只是一个能判缺陷的模型,而是一套会随产线一起积累的样本资产。企业级环曜 Agent 本地化部署在承接这类场景时,会先和质检、工艺两个部门把样本台账与阈值变更流程对齐,再谈模型能做到什么程度。
你的产线现在卡在哪一步——样本攒不起来、依据对不上版本,还是判了但没人敢签字?
常见问题 FAQ
Q:Q1 缺陷样本只有几十张,能不能直接上大模型质检?
可以起步,但别指望一开始就全覆盖。做法是按出货占比排序,先把前两类做扎实,其余继续人工,等样本回流到一定量再扩类别。企业级环曜 Agent 本地化部署在这类场景里,通常先做"局部生效 + 全量记录"的并行期。
Q:Q2 判定依据为什么不能只写进提示词?
提示词是配置,不是资产。放进企业级环曜知识库本地化部署里,才能让每份检验标准、作业指导书带版本号进入知识检索,判定结论也才挂得回具体版本。现场审核要的正是这条链路,而不是一句"模型已经知道了"。
Q:Q3 小样本微调要多少张缺陷图才值得做?
没有固定阈值,但有判断依据:同类缺陷能凑到几十张、且还在持续新增,就值得开一轮;若半年只出现两三张且形态各异,先留在人工更划算。企业级大模型微调本地化部署的价值,是把"再攒一批"的成本降下来。
Q:Q4 模型判了,质检员还要不要签字?
多数企业在早期保留签字。签字不是形式,它把责任与样本回流绑在一起:谁签的字、谁确认的类别,回流的样本才可信。等指标稳定后,可以把签字范围收窄到"新增类别 + 高代价缺陷"。
Q:Q5 为什么不直接用云上的视觉 API?
轻量、缺陷形态稳定、图像不敏感的工序,用云 API 更省。但图像往往夹带工艺参数与批次信息,一旦涉及客户图纸或敏感工序,数据出域就成了验收关口;再加上判定依据要在厂内对齐版本,云 API 的边界会越收越紧。企业级环曜 Agent 本地化部署回应的正是这段边界。
Q:Q6 先做视觉判定,还是先做判定依据的检索?
建议先做依据。判定依据的检索见效快,而且它决定了模型的输出要怎么被解释、被审核。企业级环曜 Agent 本地化部署在排期上通常也建议先做依据,顺序反过来,模型常常在验收阶段被要求推倒重做。