你负责训练一个多语 ASR 学生模型,线上每天产生 N 条未标注语音样本,每条样本有语言预测分布、时长、噪声等级、当前学生模型 loss/entropy、以及 K 个语言专门化教师模型的离线评估表。调用教师生成伪标签有成本:不同教师在不同语言/噪声下质量不同、推理耗时不同,且每天 GPU 预算 B、端到端产线 SLA 要求 6 小时内完成;同时为了避免多语联合训练优化冲突,每个 mini-batch 内希望语言分布不要过度倾斜,并限制低置信伪标签比例。 请设计一个“样本-教师选择与训练批次构造”方法:在预算内最大化预期蒸馏收益,并说明如何建模收益、如何处理多教师冲突、如何保证语言覆盖与低质量样本约束、时间复杂度、在线/离线一致性和数据漂移下的工程兜底。假设 N 可达 5000 万、K≤12、语言数 L≤80,不能用全量 ILP 精确求解。
我会把任务拆成三层:收益建模、预算选择、批次构造。首先对每个样本 i 和教师 t 估计一个净收益 score(i,t)=E[student improvement]-λ1·cost(t,i)-λ2·risk(i,t)。E[student improvement] 可以由学生不确定性、历史同语言同噪声桶上的 teacher-student KL、教师 WER proxy、样本时长、语言稀缺度权重组成;risk 包括教师低置信、语言识别不确定、噪声 OOD、教师间分歧等。多教师冲突不直接平均,而是先做 teacher gating:对每个样本只保留 Pareto frontier 上的教师,即质量高、成本低、风险低的非支配候选,再用校准后的质量估计选择 top-m 候选,必要时用教师一致性作为附加收益,分歧过大的样本进入人工/弱监督缓冲池或降权训练。 预算选择上,不能全量 ILP。我会按语言、噪声、时长、学生 entropy 分桶,把 5000 万样本压成若干 cohort,每个 cohort 统计数量、平均成本、收益分布分位数。对每个 cohort 和教师构造若干“取前 q% 样本”的候选动作,每个动作有收益、GPU 成本、预计 wall time、低置信比例贡献和语言覆盖贡献。然后做近似多约束背包:主约束是 GPU 预算 B 和 6 小时产线时间,附加约束是每种语言最小/最大采样量、低置信样本上限。工程上可用拉格朗日松弛:把语言覆盖、低置信比例、SLA 违约转成动态 penalty,按 adjusted_gain/cost 排序贪心选取,并通过二分/次梯度更新 penalty;如果需要更稳定,可在语言维度先分配 quota,再在每个语言内做一维预算 DP 或 top-k heap。复杂度约为 O(NK) 生成候选分数太贵,因此实际先用轻量路由模型或表查分桶做到 O(N·k'),k' 是每个样本候选教师数,通常 1-3;cohort 级优化是 O(M log M) 或 O(L·C·B'),M 是候选动作数,远小于 N。 批次构造阶段,把已选样本按语言、时长、置信度分层队列组织。每个 batch 用受约束采样:满足 token/frame 数上限、语言比例上限、低置信比例上限,并尽量混入相近长度减少 padding。可以把 batch 构造看成在线 bin packing + 分层抽样:先按长度桶建堆,再按语言 quota 轮转抽取;对稀缺语言设置温度采样或最小保留队列。训练 loss 上使用 teacher quality 作为 soft label 权重,高分歧样本降低权重或只蒸馏中间表示,避免错误伪标签主导。 在线/离线一致性方面,教师推理、特征抽取、分桶、打分都要版本化,训练样本 manifest 记录 teacher version、路由分数、语言预测、伪标签 hash、过滤原因,保证可复现。数据漂移上,监控每个语言/噪声桶的输入分布、教师置信分布、学生 loss 分布和蒸馏后 dev WER;发现某桶收益变负时自动降低 quota 或切到保守教师。兜底策略包括:保留一部分随机探索流量更新收益估计;对新语言/新噪声优先选通用教师加低权重;SLA 临近时按收益密度降级跳过长音频或高成本教师;低置信比例超阈值时直接截断对应队列。
强回答应先把“多教师蒸馏”转成受约束优化任务,而不是泛泛说用最好的教师。关键覆盖点包括:收益函数如何校准、成本和风险如何进入目标;多教师冲突如何通过 gating、Pareto frontier、分歧检测或加权 loss 处理;如何在 N=5000 万规模下避免全量 ILP,使用分桶、拉格朗日松弛、近似背包、quota 或堆式贪心;如何构造满足语言均衡和低置信约束的 batch;以及如何做版本化、漂移监控和 SLA 降级。常见错误是只按教师置信度排序、不考虑样本时长导致 GPU 预算失控;只追求高 entropy 样本但忽略伪标签风险;把所有教师 logits 简单平均造成语言专门教师互相污染;或者提出精确 ILP/全量 pair scoring 却无法落地。出练习者会继续追问收益估计偏差、约束不可行时的处理、以及线上产线超时和训练效果回退的机制。
- 如果某些低资源语言样本很少但教师质量也差,quota 应该如何设置才不会负迁移?
- 如何设计 A/B 或离线反事实评估来证明该调度策略优于固定教师策略?
- 如果教师推理结果缓存占用巨大,如何决定哪些伪标签需要保留、复算或淘汰?