第9章实践:看图盘点助手——把"看起来像"变成证据分级
预计 2×45 分钟。先完成"观察与运行",再完成"单变量修改与解释"。
第1步:需求与背景
为什么做这个
你用摄像头拍了一张书桌的照片,让AI模型列出桌上有什么。模型说:"一台笔记本电脑、一本书、一个杯子、一副耳机。"看起来很流畅,但你定睛一看——耳机是旁边椅子上挂着的不桌上,杯子其实是空的而且模型没提到。
视觉模型的问题在于:它说得很自信,但不一定很准确。遮挡、低光、小字、角度和场景先验都可能导致视觉幻觉。
本章不训练视觉模型,而是用课程提供的图片(或摄像头)测试模型的回答,并把每句结论标为证据等级:画面直接可见、疑似、无法确认。
项目目标
制作一个"看图盘点"小助手:
- 输入:一张课程授权的桌面/文具图片
- 输出:物品清单,每项标注证据等级(A/B/C)
- 两种提问方式:开放提问 vs 约束提问
- 验收标准:能指出模型哪些说法有图像证据、哪些是编造的
明确不做
- 不训练自己的视觉模型
- 不使用真实人脸、证件或个人照片
- 不把图片描述直接用于高风险决定
系统全景
课程授权图片
↓
视觉模型(本地VLM或录制输出)
↓
候选描述 → 证据分级规则
↓
A: 画面直接可见 / B: 疑似 / C: 无法确认
↓
扰动对照(遮挡/裁剪/低清)→ 人工看原图核验
第2步:数据与信号
图片从哪来
本章使用课程提供的 6张合成示意图(不是真实照片),覆盖以下场景:
| 图片 | 内容 | 测试重点 |
|---|---|---|
| desk_normal.png | 正常书桌:笔记本、书、笔、杯子 | 基线 |
| desk_occluded.png | 部分物品被遮挡 | 遮挡导致漏检 |
| desk_dark.png | 低光环境 | 光照影响 |
| desk_tricky.png | 有打印的图片(假物品) | 模型能否区分真实和打印 |
| desk_cluttered.png | 杂乱桌面,物品多且小 | 密集场景 |
| desk_empty.png | 空桌面 | 模型是否会编造物品 |
如果图片文件不可用,Notebook 使用预录的模型输出完成全部A档观察。
视觉模型怎样工作
视觉模型(多模态大语言模型)接收一张图片和一段文字提问,输出文字回答。
图片像素 → 视觉编码器 → 图像特征向量
→ 语言解码器 → 文字回答
提问文字 → 文本编码器 → 文本特征向量
关键理解:
- 模型不是"看到"图片,而是把像素变成数字特征,再根据特征生成文字
- 特征提取有局限:小字、低对比度、遮挡区域可能丢失信息
- 语言解码器可能"补全"它没看到的内容——这就是视觉幻觉
证据分级规则
| 等级 | 含义 | 判断标准 |
|---|---|---|
| A | 画面直接可见 | 能在原图中指出该物品的位置 |
| B | 疑似 | 根据局部特征推测,但不能完全确认 |
| C | 无法确认 | 画面中没有足够证据,模型可能在编造 |
第3步:AI原理
视觉模型为什么会"编造"
- 场景先验:模型在训练时见过大量"书桌上有电脑"的图片,所以即使图片模糊,也可能"补全"一台电脑
- 语言流畅性:模型倾向于生成流畅、完整的描述,而不是诚实地说"看不清"
- 分辨率限制:小物体、远处物体在特征提取阶段可能已经丢失信息
- 遮挡推理:模型看到物体的一部分,可能推测完整物体的存在
规则模型 vs 视觉模型
本章的"证据分级"是一个规则模型——人写的规则,不是学出来的。它的作用是:
- 对视觉模型的输出做后处理
- 强制模型(或学生)为每个结论提供证据
- 把"看起来像"变成"有证据支持"
这种分工在AI系统中很常见:学习模型负责候选,规则模型负责约束和检查。
第4步:协同开发
使用 Qwen Code 完成以下任务(选择一项):
任务A:为证据分级规则新增一条规则
- 例如:"如果模型提到颜色,但图片是黑白的,自动标为C"
- 先预测这条规则会影响哪些结论
任务B:修改一张图片(裁剪或降低分辨率),观察模型输出变化
- 使用 Notebook 中的图片处理代码
- 先预测裁剪/降质会让哪些结论从A变成B或C
第5步:测试与边界
必测项目
| 测试 | 图片 | 预期 |
|---|---|---|
| 正常 | desk_normal.png | 大部分物品应为A |
| 遮挡 | desk_occluded.png | 被遮挡物品应为B或C |
| 低光 | desk_dark.png | 细节减少,B/C增多 |
| 空桌 | desk_empty.png | 不应列出任何物品(C=编造) |
| 打印图片 | desk_tricky.png | 模型应区分真实物品和打印图片中的物品 |
人工兜底
- 视觉模型不可用时,使用预录输出完成A档观察
- 所有结论必须能指回原图
- 不上传人脸、证件或个人照片
- 不把图片描述直接用于高风险决定
第6步:交付与验收
交付物
- 开放/约束回答对照:同一张图片,两种提问方式的结果对比
- 证据分级卡:每张图至少3个结论的A/B/C分级
- 扰动对照:至少1次遮挡/裁剪/降质的前后对比
- 模型纠错:至少3处模型说法被人工修正
- 隐私检查表:确认没有敏感内容
验收标准
- [ ] 所有结论能指回原图
- [ ] 不上传人脸、证件或个人照片
- [ ] 能区分规则模型和视觉模型
- [ ] 模型失败时有清晰的人工兜底
- [ ] 离线模式可完成A档观察
第7步:迁移与拓展
核心方法迁移
"证据分级"的思路可以迁移到:
- 医学影像:AI标注的疑似病灶需要医生确认
- 自动驾驶:视觉模型识别的行人需要安全冗余验证
- 质检:AI判断的产品缺陷需要人工复核
拓展任务(选做)
- 用本地摄像头拍摄自己的桌面,测试模型在你真实环境的表现
- 比较不同视觉模型(如 Qwen-VL vs 其他)的同一图片描述差异
- 设计一个"视觉幻觉检测器":自动标记模型描述中可能编造的内容