附录A 目标测试参考答案
选择题给出最佳答案和简要理由;判断改错题先判断,再改正错误表述;简答与操作题给出评分要点,学生可以使用与参考答案不同但证据充分的表达。
第1—4章目标测试参考答案
第1章
-
答案:B。 “万能企业助手”未定义样本、标签、输出、拒绝条件和验收标准,不能直接成为监督学习任务。
-
答案:C。 插座冒烟是高代价风险,须由确定性规则在模型前拦截并转人工紧急渠道。
-
答案:B。
TextVectorization词表是模型状态;用验证集或固定测试adapt会泄漏信息,使评估虚高。 -
答案:C。 0.90是四个候选类的相对支持,不是事实正确率,不能越过规则门、分差和人工确认自动派单。
-
判断:错误。 高风险漏拦不能被平均分抵消;5例必须全部在模型前拦截,否则退回并全量回归。
-
判断:错误。 可不从零手写,但要说明数据向量化、Embedding、Softmax及模型—规则—阈值—网页的连接,并审查AI修改、运行固定回归。
-
评分要点(共4分): 业务设备类纳入扫码枪、业务电脑、会议音视频设备、订单打印机和叫号屏等普通使用故障,排除内部诊断及网络账号问题,由业务设备责任人确认(2分);公共设施类纳入作业照明、桌椅、门窗和饮水机等,冒烟、漏电、受伤必须转高风险人工渠道,由设施与安全责任人确认(2分)。语言模型无权决定边界。
-
评分要点(共5分): 低成本、可重复、均衡生成带标签数据,便于跑通训练链(1分);句式和场景有限,可能只记模板(1分);非真实采集与责任人标注,不代表口语、比例、噪声和风险(1分);隔离普通、陌生、多意图、信息不足和高风险固定测试(1分);不得回灌训练或逐题调参(1分)。
-
评分要点(共5分): A/B只把最高分门槛由0.60改为预定值(如0.70)(1分);数据、模型、标签顺序、0.12分差门、风险/多意图规则、测试、环境和程序不变(1分);预测提门槛会少建议、多复核、可能少误放(1分);全量记录三类通过数/率及去向变化(1分);比较错误建议、人工量并下结论(1分)。
-
参考结论:退回修改。 多意图强行单分、高风险漏拦和无法复现分别说明接管链、否决门和交付未完成。把经确认的风险规则置于模型前,多领域线索转人工,补齐依赖、模型、README和验收入口;重跑29条固定样例、故障测试和他组复现,5条高风险必须全部拦截。
第2章
-
答案:B。 模型读取的型号首先是候选值,只有回到原图核对并经过相应责任人确认后,才能进入发布数据。
-
答案:C。 没有单位的数值无法可靠解释,应进入问题表并回查原件,不能默认单位或用0代替。
-
答案:B。 按设备或批次整体隔离,可以减少同一对象的相邻、近似记录同时出现在训练和测试中的泄漏。
-
答案:C。 “通过结构校验”只说明记录符合当前字段、类型和允许值规则,不等于事实、授权、标签或训练适用性均已确认。
-
判断:错误。 缺失表示没有足够信息;0是一个可能具有专业含义的实际数值。二者必须用不同方式保存和处理。
-
判断:错误。 扩大同一偏差来源的数据会重复甚至放大偏差。项目仍需检查对象、设备、时间、环境和标签分布,并补充有计划的代表性材料。
-
评分要点(每项1分,任选四项,共4分): -
source_id:为原件提供稳定编号; - 文件名或保存位置:能够找到原文件; - 提供者与获取日期:说明材料从何时、何人或何组织获得; - 授权范围:说明是否允许课堂处理、共享或发布; - 文件摘要:发现原件是否被替换; - 隐私或备注:记录需要限制访问的信息。 -
评分要点(共4分): 校验程序把该记录写入问题表,而不默认单位(1分);人工按
source_id回看原件并联系材料责任人(1分);确认后保留原值、补充单位并记录修改前后值、依据和修改人(1分);重新运行校验和固定测试生成新版本(1分)。若无法确认,应保留缺失或排除记录,不得猜测。 -
评分要点(共4分): 预测增加单位必填规则会发现更多待处理记录(1分);原件、候选记录、模型输出、程序其他规则和测试集保持不变(1分);A、B两版只在单位必填规则上不同(1分);比较新增问题数、错误单位数、通过记录数和人工复核时间(1分)。
-
参考结论:退回交付。 找不到原件即来源链断裂。应补齐记录—原件映射并核对摘要;无法恢复的记录须隔离并说明原因,再生成版本并由他组回查。参考工程中5个原件摘要一致,8条候选4条通过、4条拒绝,6条冻结测试通过;结论仍仅为
usable_for_teaching_only,不能外推真实事实或模型性能。
第3章
-
答案:B。 最高相似度只表明在当前字符TF-IDF表示中,问题与该段落共享的加权字符片段较多,不证明资料真实、有效或足以支持答案。
-
答案:C。 引用编号集合检查是确定性任务,适合普通程序执行;程序仍不能判断段落在语义上是否支持结论。
-
答案:C。 无证据时必须显式停止并列为待确认,避免语言模型依据通用记忆或常识补出项目事实。
-
答案:B。 关键词基线可以判断字符TF-IDF检索是否带来实际改善,也适合型号、条款编号等需要精确匹配的内容。
-
判断:错误。 合法编号只说明引用来自允许的命中集合。还需检查段落是否包含对应条件、是否适用于当前对象,以及结论有没有超出原文。
-
判断:错误。 加入过期、无关、来源不明或对象不匹配的资料会增加误命中和冲突。资料应按任务、版本、时效和适用范围筛选。
-
评分要点(每类1分,共3分): - 事实问题:“当前设备的型号、指示灯和闪烁现象是什么?” - 规则问题:“该型号说明书允许普通使用者执行哪些检查或重启步骤?” - 专业判断问题:“当前状态是否可以继续使用,还是应停止并交设备人员?” - 表述不同但类型和责任清楚即可得分。
-
评分要点(共4分): 准备两份均在检索库中的资料,对同一条件给出相反规定,并记录各自版本与有效状态(1分);提出能同时命中两份资料的问题(1分);期望输出并列引用冲突,不自行选边(1分);把最终解释和采用转给指定专业责任人(1分)。
-
评分要点(共4分): 先预测
top_k=2相对3可能减少无关命中,也可能漏掉条件或冲突资料(1分);使用data/calibration_qa.json,资料、字符n-gram、TF-IDF、分数门槛和路由规则保持不变(1分);两版只改变top_k,不得查看冻结题成绩后反复选参(1分);比较正确证据命中、冲突检出、未知问题错误放行、无关段落和人工核对量,再一次性运行冻结题集(1分)。 -
参考结论:
not_ready_for_use。 两套方法虽均为11/12,失败后果不同:字符TF-IDF把未知问题错误放行,关键词则对同义改写安全拒答。下一轮应扩充独立校准集,研究拒答门、分差或双系统组合,不得针对Q09写补丁。冻结题只在方案确定后运行;可复现不等于达到发布门。
第4章
-
答案:C。 它明确了静态SVG提示卡、目标受众、10秒观察时间,以及“说出三项行动中的至少两项”这一可检查标准,可以通过不诱导的用户测试验证。
-
答案:B。 普通SVG程序可以把经过核验的文字、尺寸、安全区、披露和几何图形写成确定性输出,避免生成模型随画面一起改错事实或规格;它仍不能代替事实、权利和用户审核。
-
答案:A。 尺寸检查只证明文件满足一个确定性规格,不能证明事实、权利、专业规范和发布批准均已通过。
-
答案:B。 保持项限制无关变化,使项目组能够判断当前修改的影响,并防止修好一处破坏其他部分。
-
判断:错误。 生成过程仍可能涉及无权使用的输入、人物、声音、标志或与既有作品过近的输出;还需核对平台条件、单位规定和具体发布环境。
-
判断:错误。 用户测试主要说明受众是否理解和遇到什么困难,不能替代事实、品牌、专业规格、权利和发布责任人的审核。
-
评分要点(每项1分,任写六项,共6分): 可观察目标(未参与制作的学生看静态卡10秒后,至少说出三项行动中的两项)、主要受众与使用地点、三项行动及事实来源、1080×1440静态SVG规格与顶部安全区、语气和视觉层级、禁用数字与未授权素材、匿名用户测试方法、事实/设计/权利/发布审核人。只写“好看、科技感”等不可检查形容词不得分。
-
评分要点(共4分): 指定修改对象(1分),说明可观察变化(1分),列出至少两项保持内容(1分),给出检查方法(1分)。示例:“只调整主视觉背景和光线,提高三项行动与背景的明暗对比;保持人物为空、行动文字、标题安全区、1080×1440静态SVG规格和事实信息不变;修改后用同一10秒理解测试和规格检查比较。”
-
评分要点(共4分): 预测增加安全区会提高可排版候选比例,但可能压缩主体(1分);固定模型、基础描述、画幅、参考材料和候选数量(1分);A版不写安全区,B版只增加“上方标题安全区”条件(1分);比较安全区可用率、主体完整性、修图时间、规格通过率或10秒理解度中的至少三项(1分)。
-
参考结论:退回修改,不得发布。 未授权标志和无来源比例均是否决项;须移除、重生成或补齐可靠来源与授权,再重做权利、事实、规格及必要的10秒理解测试。参考工程19项测试通过,但G02因“节电30%”无来源失败,G03有7个问题;真实目标用户为0人、人工批准0/4,故状态为
not_ready_for_release。
第5—8章目标测试参考答案
第5章
-
答案:C。 目标日实际用电只有在目标日结束后才产生,形成预测时尚不可得。把它作为输入等于提前给出答案,属于未来数据泄漏。
-
答案:B。 时间序列评价要模拟“只能用过去预测未来”。随机打乱会让未来季节、活动和制度模式进入训练,破坏真实使用顺序,使成绩过于乐观。
-
答案:B。 模型与基线必须在完全相同的未来日期、目标单位和指标上比较。代码长度、训练轮数和内部结构不需要相同。
-
答案:C。 模型在教学生成数据上降低了平均误差,但仍漏掉一个峰值,只能作为教学合成数据范围内的人工观察候选。它不具备自动控制权限,迁移到真实门店前还需重新训练、验收,并由正式规则和人员复核峰值。
-
判断:错误。 归一化均值和标准差也是从数据获得的模型状态。若使用全部220天计算,验证与测试期的分布已提前进入训练流程。应只用训练样本计算,并把同一状态用于验证、测试和运行。
-
判断:错误。 第5章输出只是下一日负荷候选,可作为第6章任务量或资源需求的一个输入。正式排程还要满足技能、时间窗和资源等约束,设备控制还须专业安全规则与人工批准。
-
评分要点(共6分): 对象为一家小型门店营业区下一自然日用电量(kWh)(1分);预测时点为前一日结算后(1分);可用字段任二:前7日用电、已发布温度预报、周末/星期、已确认促销活动(2分);禁止字段任二:目标日实际用电/实测温度、事后运行时长/处置(2分)。
-
评分要点(共5分): A用7日、B只改14日平均(1分);固定开发数据、目标、缺失处理、模型、指标和验证期,不读冻结测试(1分);从共同具备14日历史的日期起比较(1分);预测14日更平稳但响应更慢(1分);记录MAE、最大误差、峰值召回和逐日变化(1分)。
-
评分要点(共4分): - 陌生测试示例:计量口径改变、新建筑接入、训练未见极端天气或长时间停课(1分); - 预期:标记超出验证范围,停止模型候选并转数据/能源责任人(1分); - 故障测试示例:日期重复或乱序、负负荷、历史不足7天、模型或元数据缺失(1分); - 预期:程序明确报错并停止,不用零补齐或沿用缓存预测(1分)。
-
参考结论:退回模型,保留7日基线。 新模型MAE 7.1 kWh高于基线6.7 kWh,峰值也未改善。保留报告并只改一项数据或模型;数据责任人确认口径/字段,能源责任人确认后果/边界。先在训练和验证期重跑基线、模型、峰值及故障测试;冻结新版本后用新未来期验收。已用于改进的原冻结期不再独立。
第6章
-
答案:C。 班组技能必须匹配工单,是决定方案能否执行的硬约束。“尽量少等待”和“尽量早点结束”只在可行方案之间比较。
-
答案:B。 J01先提交且A组在列表中靠前,先到先服务把它排入A组0—4;只能由A组处理、需在时段4前完成的J02随后没有空档。
-
答案:B。 “先处理剩余空间最小的工单”只改变搜索顺序,帮助更早处理受限任务;本项目仍枚举所有合法班组和整数开始时段,不会自动放宽约束。
-
答案:C。 无可行解是有价值的业务结果。程序应输出冲突与当前条件,由有权限的人决定是否调整期限、资源或任务范围,不能自行删除或修改。
-
判断:错误。 超过任何硬时间窗的方案都不是可行解,目标值再小也不能进入比较。只能在全部硬约束通过的方案间选择目标值较小者。
-
判断:错误。 搜索代码本身可能存在遗漏或实现错误,应由分离的验证函数再次检查任务完整、技能、时长、班次、时间窗和重叠,并由人员核对未建模现实条件。
-
评分要点(共5分): 硬约束任三:每单一次、技能匹配、班组不重叠、班次与时间窗内完成(3分);软目标为降低加权等待并轻度压缩最晚完成时点(1分);业务人员确认约束/目标,程序只计算(1分)。
-
评分要点(共4分): J02只能由A组处理且时间窗紧,应优先保留A组(1分);J01的网络技能A/B均有(1分);J02置A组0—3,J01置B组或A组稍后(1分);独立验证其他工单、时间窗和不重叠(1分)。
-
评分要点(共4分): - 陌生测试示例:跨日任务、双人协作、未知技能或需要地点路程但数据结构没有相应字段(1分); - 预期:拒绝计算并要求扩展合同与数据,不静默忽略(1分); - 故障测试示例:负时长、重复编号、结束早于开始、空班组或错误JSON(1分); - 预期:搜索前校验失败并记录明确原因(1分)。
-
评分要点(共6分): J02需5时段而0—4窗口只有4个,已无解(1分);责任人可批准延期、拆分、增加电气资源或调整范围,任二(2分);这些都改变业务合同,程序无权自行采用(1分);变更后重跑校验、正常/无解/变更/故障测试及独立验证,保留原场景和批准记录(2分)。
第7章
-
答案:B。 一幅图中有多个对象且需要输出问题对象的位置,应使用目标检测;整图分类只给整张图的类别。
-
答案:B。 同一对象的连拍和同一批次的相似背景必须整体进入一个集合,避免模型通过记忆对象或批次获得虚高测试分数。
-
答案:C。 规则只检查绿色封签,能够发现缺封签,却会把仍有封签的撕裂、压角或污渍当作合格候选。
-
答案:C。 48×32圆形包装超出登记的32×32结构,系统应在模型前转人工。缩放后强制二选一会隐藏输入已陌生的事实。
-
判断:错误。 25/25只表示双阈值筛出的25个明确候选均正确;另有23张转人工。模型在0.5阈值下的全部48张分类结果为36/48,即75%,不能把候选正确率替代整体测试成绩。
-
判断:错误。 测试错例进入训练后,原测试集已参与改进,不再是独立证据。新版本要保留旧报告,并使用未参与训练和调参的新批次验收。
-
评分要点(共4分): - 分类:给整幅单包装图输出合格/待复核候选(1分); - 检测:在多包装图中输出问题包装的矩形位置(1分); - 分割:标出裂缝、污渍或病斑的像素区域(1分); - 本项目一图一个主体,只需候选状态,所以选择分类(1分)。
-
评分要点(共5分): - A版
intact_max=0.35,B版只改为0.25(1分); - 固定模型、B07—B08验证批次、review_min=0.65、输入门和标签,不读取B09—B10冻结测试(1分); - 预测降低合格上限会减少合格候选并增加人工复核(1分); - 记录合格候选、待复核候选、人工复核三种数量(1分); - 同时记录候选正确率和真实待复核被送入合格候选的漏检(1分)。 -
评分要点(共6分): - 边界:分数在0.35或0.65附近、允许范围内的轻微亮度变化;预期按双阈值转人工或稳定分流,模型可运行(2分); - 陌生:48×32新结构、无关图片或未见产品线;预期模型前转人工,模型不运行(2分); - 故障:损坏PNG、模型缺失、清单泄漏或路径不存在;预期明确失败或转人工,不沿用缓存(2分)。
-
参考结论:退回CNN,保留规则与人工复核。 新CNN 60%低于规则66.67%,漂亮界面不能抵消模型证据变差。学生或开发者保存失败报告并限定一次修改;数据与质量责任人确认标签、批次和漏检门;另一组复现。修改后重跑对象/批次泄漏检查、48张冻结批次、规则与CNN混淆矩阵、双阈值覆盖、8张陌生图和故障测试;若原测试已用于调参,再准备新批次。
第8章
-
答案:A。 相邻窗口共享设备、位置、负载、增益和背景,随机跨集合会形成会话泄漏,使测试样本像训练近邻。
-
答案:B。 RMS概括一段声音的整体能量,不直接说明频率结构、具体故障部件或维修方案。
-
答案:B。 合成数据让两类整体RMS接近,异常主要体现在频率成分和幅度调制,因此只看响度的规则漏掉全部异常。
-
答案:B。 D01来自未登记设备或工况,特征漂移。系统应在模型前转人工并核对采集情境,不能把最高分用于自动停机。
-
判断:错误。 32/32只是在两个未见会话的合成已知模式上取得,数据由同一公式生成。它不能代表真实设备、陌生异常或故障诊断,最终仍只允许低风险提醒与人工确认。
-
判断:错误。 运行声音只能进入待审核区。需检查授权、设备、工况和标签,按会话建立新版本,离线评价并经责任人批准后,才能用于模型更新。
-
评分要点(共4分): - 同一会话相邻窗口共享情境并非独立样本(1分); - 随机划分可能让模型记住设备、房间或增益,获得虚高分(1分); - 应先按
session_id分组,再把完整会话放入训练、验证或测试(1分); - 最终测试还应包含未见会话、设备或现场条件(1分)。 -
评分要点(共5分): - 固定模型分数、S07—S08验证会话、七个特征、归一化和漂移门,不读取S09—S10冻结测试(1分); - A版阈值0.50、B版只改为0.70(1分); - 运行前预测提高阈值通常减少误报、可能增加漏报(1分); - 两版统计真正正常、误报、漏报和真正异常(1分); - 同时记录人工区数量和结合错误后果的使用判断(1分)。
-
评分要点(共6分): - 边界:分数接近阈值或允许范围内轻微增益变化;模型可在输入门通过后运行,低信心转人工(2分); - 陌生:新设备、麦克风位置或未登记负载;漂移门接管,模型不运行(2分); - 故障:静音、削波、错误采样率、损坏WAV或模型缺失;明确报错或转人工,默认不行动(2分)。
-
评分要点(共5分):
- RMS等规则适合能量或专业阈值可明确表达的情况(1分);
- 有标签分类适合正常与已知异常都有可靠标签的任务(1分);
- 只用正常数据的异常检测适合异常稀少、类型开放但正常范围可建立的任务(1分);
- 本章有明确生成的正常/已知异常标签,因此选择二分类(1分);
- 只实现一条模型路径可使数据条件、评价和责任清楚,避免把不同机制混成一个“异常AI”(1分)。
第9—12章目标测试参考答案
第9章
-
答案:B。 H0用预录数据或虚拟接口跑通模型、规则、日志和故障测试;它还能帮助定位真机适配问题,但不能证明真机长期稳定。
-
答案:C。 设备事实须由准确型号的官方资料和真机日志核对;模型记忆或相似型号帖子只能提供查找线索。
-
答案:B。 单位、输入质量、超时和阈值是确定性条件,应由规则检查;模型只输出类别、概率或异常分数。
-
答案:B。 比较量化效果时只改量化方式,固定任务、数据、设备和指标,才能归因大小、延迟及误差变化。
-
判断:错误。 H0是正式学习与调试路径,可完成除真机采样和长期稳定性以外的主链验证。
-
判断:错误。 高置信度仍须经过质量、超时、阈值和白名单规则;本项目只观察、记录和提示,不直接控制危险设备。
-
评分要点: 写出物理现象;传感器、适配与预处理;单位、频率或形状;模型输出;独立规则、日志和人工确认。
-
评分要点: 写明型号、接口、连接条件、单位、频率、格式、官方资料与最小示例;列出至少两项禁止事项和需保存的真机日志。
-
评分要点: 固定模型、预处理、样例、阈值和指标,只改部署位置;比较质量、启动/推理延迟、资源、断网、隐私、费用和维护,据此作采用判断。
-
评分要点: 设备断开、模型缺失、输入越界分别进入明确停止状态,记录版本和原始异常;不得沿用旧值,人工排查后重新读取并回归。
工程验收补充: 在resources/ch09/project/运行python acceptance.py --require-model。参考环境中,3000条合成数据按2400/600划分,验证准确率0.976667;Keras、float JSON和INT8 JSON在12条冻结样例上决策一致。INT8 JSON比float JSON大6.667%,两种标准库推理中位数同为0.0022毫秒,不能宣称量化一定更小或更快。10条系统样例还验证断网、边界、质量未知和五类停止状态;模型只拟合合成标签,安全规则位于模型之外。
第10章
-
答案:B。 必填字段和阈值适合确定性规则;理解含糊委托或生成候选说明才可能需要语言模型。
-
答案:B。 检索只返回材料、来源和相关信息,不能越过生成、规则和人工确认直接批准。
-
答案:B。 幂等保护让同一编号、同一内容的重复提交返回原结果,不再产生副作用。
-
答案:B。 超时不等于未执行,应先按事件编号或幂等键查询,再决定返回、重试或转人工。
-
判断:错误。 状态转换、角色权限和安全规则须由可检查的程序及责任人预定,不能由语言模型临时改写。
-
判断:错误。 检索命中后仍要核对权威性、时效、范围和引用支持;无依据或冲突时停止或转人工。
-
评分要点: 从
RECEIVED、ANALYZED、EVIDENCE_FOUND、PROPOSAL_READY、AWAITING_CONFIRMATION、COMMITTED、CLOSED_NO_ACTION、MANUAL_REVIEW中写至少六个状态及进入条件;恢复用RESUMED留痕;至少写一个停止条件。 -
评分要点: 模型识别或给候选,检索返回依据,规则校验字段与禁区,状态机限制转换,权限限制角色,人员核对并负责。
-
评分要点: 测试同编号同内容、同编号不同内容、重启后重交三种情况;前者只保留一次提交,冲突必须停止并留痕。并发唯一性尚未证明,真实系统须另验收数据库事务。
-
评分要点: 当前
propose()是受证据约束的确定性模板。允许语言模型自由改写即构成新系统,须新增无依据动作、承诺和诊断测试;状态、权限、幂等及批准责任仍由程序和人员控制。
工程验收补充: 在resources/ch10/project/运行python acceptance.py。验收现场重建路由配置、字符TF-IDF质心模型和36条重放事件;模型与关键词基线均为7/7,11项单元测试和8项操作约束通过。同载荷重试不新增提交,同编号异内容停止;写入失败恢复、重开还原和preview_digest确认均须留痕。该结果不证明模型优于基线,也不声称已实现真实身份认证、自由生成或并发事务。
第11章
-
答案:B。 验收门应从任务合同和错误后果出发,再选择质量、安全、延迟和成本指标。
-
答案:B。 固定测试要与训练隔离;更新后的版本仍须用未参与改进的样例验收。
-
答案:B。 试运行限制人员、时间和数据,并保留人工监督,用来发现新问题,而非直接扩大范围。
-
答案:B。 高代价错误触发时按预案停止、限用或回滚,保留版本与日志,不得为过关降低门槛。
-
判断:错误。 越权写入可单独否决版本,不能被总准确率抵消。
-
判断:错误。 现场修正先进入待审核经验区,须经授权、清洗、标签复核、离线更新和独立验收才可能进入新版本。
-
评分要点: 列两类普通错误和一类高代价错误;分别设置量化门与零容忍/逐条复核门;写明批准人和失败动作。
-
评分要点: 固定集覆盖正常、边界、陌生、诱导、故障和权限变化;每条含编号、来源、预期、高代价标记和适用版本。
-
评分要点: 离线测试比较模块质量,系统验收检查组合、权限与恢复,有限试运行观察真实环境;三类证据不可互相替代,应逐级扩大范围。
-
评分要点: 由监测证据发起限定变更,在隔离副本修改并审查差异,运行全量回归;责任人批准后发布,触发门槛即回滚且保留失败证据。
工程验收补充: 在resources/ch11/project/运行python acceptance.py。人工基线4/8,stable-v1为8/8并通过发布门,risky-v2为3/8并被拦截;试运行触发告警并回滚到stable-v1。11项单元测试同时拦截制品篡改、预填答案、归因缺失和混合版本。这些是课堂冻结制品的结果,不代表已直接验收第10章源码。
第12章
-
答案:B。 综合项目应按任务、输入、规范和错误后果选择最少必要技术;模型数和代码量不能证明价值。
-
答案:B。 另一组在独立环境安装、运行并恢复故障,能暴露依赖、路径、版本和隐含假设。
-
答案:B。 最小闭环要求一个边界明确的问题从真实输入走到有责任人的输出,不要求堆叠全部技术。
-
答案:B。 运行经验须经授权、清洗、审核、离线更新和固定验收,现场系统不能自行改变关键行为。
-
判断:错误。 功能越多,接口、依赖和失效点也越多;应以问题价值、测试、复现和交接评价。
-
判断:错误。 原组电脑可能依赖缓存或私有路径,须由另一组在干净环境按书面交付包重建。
-
评分要点: 写清使用者、授权输入、候选输出、模型分数/证据、停止和人工接管;系统只观察提示,不控制危险设备。
-
评分要点:
data/、models/、src/、tests/、logs/、docs/职责清楚;根目录README和环境清单给出唯一入口及期望结果。 -
评分要点: 接手组在干净环境安装,运行成功样例和全量测试,制造并恢复一个故障,说明边界与责任;原组只能观察并接收书面问题。
-
评分要点: 发起限定变更,冻结版本,用AI协助修改并审查差异;重跑正常和故障回归,记录批准及回滚条件,失败时恢复上一基线。
工程验收补充: 在resources/ch12/project/运行python acceptance.py。参考结果为12/12固定集成样例、7项操作约束和7项单元测试通过;人工基线安全处理12/12但自动证据为0,助手只为2个普通事件自动找到依据。四个高风险场景必须进入EMERGENCY_HANDOFF。independent_team_reproduction=PENDING_CLASSROOM须保留:自动预检不能替代真实另一组复现。