每日练习与编程练习

← 返回日报
任务 第一则

查询引导长视频采样

任务 94/100

你要为一个长视频问答系统设计“查询引导视觉采样”模块:单个视频最长 6 小时,离线已抽取每秒 1 帧的视觉 embedding、OCR、ASR 片段和镜头边界;在线输入一个自然语言 query 后,最多只能送入 VLM 4096 个视觉 token,端到端 P95 延迟要求 800ms。每帧 i 有 query 相关分数 r_i、token 成本 c_i、时间戳 t_i、镜头 id,以及与其他帧的相似度可近似计算。 请你建模“选择哪些帧/片段送入 VLM”的优化目标,要求兼顾 query 相关性、时间覆盖、去冗余和预算约束;给出一个可落地方法,说明复杂度、近似性或最优性、边界条件,以及线上如何保证稳定性和离线/在线一致性。

参考回答

我会先把任务建模成预算约束下的单调子模最大化,而不是简单取 top-K 相关帧。top-K 容易集中在同一个镜头,导致长视频问答漏掉关键前后文。候选集合先通过 ANN 从视觉、OCR、ASR 三路召回,得到规模为 M 的候选帧/片段,例如 M=500~2000,再在候选集上做预算选择。目标函数可以定义为:F(S)=α·Σ_g max_{i∈S∩g} r_i + β·Σ_{u∈C} w_u max_{i∈S} sim(u,i) + γ·Σ_b min(1, |S∩b|),其中第一项是按时间桶或事件簇做 capped relevance,避免重复高分帧堆叠;第二项是 facility-location coverage,让被选帧代表候选集中的视觉变化;第三项鼓励覆盖不同时间段或镜头。约束是 Σ_{i∈S} c_i≤B、|S|≤K,并可加每个镜头最多 m 帧的 partition matroid 约束。这个 F 基本是单调子模函数,适合用贪心近似。 在线方法:第一阶段多路召回,文本 query 分别检索 ASR/OCR/视觉 embedding,合并去重,并按时间扩展邻域,例如命中帧前后各取 1~2 个关键帧,防止只取到结果帧而缺少过程。第二阶段在候选集上做 lazy greedy,每次选择单位成本边际收益 ΔF(i|S)/c_i 最大的帧,直到 token 预算耗尽;若候选成本差异很大,保留 best singleton 与 greedy 结果取优。对单 knapsack 约束有常数近似,纯 cardinality 下经典贪心有 1-1/e 近似;加镜头上限时工程上用贪心加可行性检查,理论上可提到 matroid+knapsack 的连续贪心更强但线上成本高。复杂度方面,召回 ANN 约 O(log N) 或亚线性;候选集 M 上若预先只计算候选间近似相似度,lazy greedy 约 O(L log M · cost_delta),L 是选中帧数,通常几十以内。coverage 的 max sim 可以增量维护,每选一帧更新每个候选 u 当前最大覆盖值,朴素 O(ML),M=1000、L=64 可接受。 工程上会做几件事:一是 token 成本 c_i 要用真实 VLM patch/token 估计,不用固定帧数;二是按 query 类型动态调参,例如“什么时候发生”更重时间覆盖,“画面里有什么文字”提高 OCR 召回权重;三是给高置信短视频走简单 top relevance,以降低延迟;四是对低相关 query 或无命中情况回退到均匀分层采样;五是线上记录 selected frame、score、budget、VLM answer attribution,用于离线 replay 保持一致。边界条件包括:大量相似镜头时需要去冗余;稀有事件只有一两帧时不能被 coverage 淹没,应设置 relevance 下限或强制保留 top 相关帧;ASR/OCR 与画面错位时需要时间窗口对齐;多段答案任务要避免只选一个峰值区域。最终输出给 VLM 时应携带时间戳、来源模态和局部上下文,便于答案溯源。

回答分析

强答应该先指出该任务不是排序任务,而是“相关性—覆盖—预算”的组合优化任务;能把去冗余和时间覆盖表达成子模或近似子模目标;能说明为什么 top-K、均匀采样、单路检索都有缺陷;能给出可在线运行的两阶段方案:离线建索引、在线多路召回、候选重排、预算化选择、失败回退。复杂度上要区分全视频 N 与候选集 M,不能在 6 小时视频全量两两算相似度。常见错误是只说用 embedding 检索 top-K,不考虑 token 成本、镜头重复、长程覆盖和 query 类型;或者给出复杂 ILP 但没有在线延迟可行性。出练习者会追问近似保证、非单调 diversity penalty 怎么处理、ASR/OCR/视觉分数如何校准、线上 P95 抖动如何控制。

评分
94/100
任务定义 19/20正确性 24/25复杂度 19/20工程取舍 18/20表达 14/15
追问
  • 如果 r_i 来自不同模态且分布漂移,如何做在线校准?
  • 如果 query 需要连续动作理解而不是离散关键帧,采样目标如何改?
  • 如何设计离线评测集来证明该采样器优于 top-K 和均匀采样?
类比
像给侦探从数万张监控截图里挑一小叠证据,既要最相关,也要覆盖完整时间线,不能全是同一秒的连拍。
编程练习 第二则

边界元素是最大值的子数组数目

任务 95/100

给你一个 正 整数数组 `nums` 。

请你求出 `nums` 中有多少个子数组,满足子数组中 第一个 和 最后一个 元素都是这个子数组中的 最大 值。

示例 1:

输入:nums = [1,4,3,3,2]

输出:6

解释:

总共有 6 个子数组满足第一个元素和最后一个元素都是子数组中的最大值:

  • 子数组 `[1,4,3,3,2]` ,最大元素为 1 ,第一个和最后一个元素都是 1 。
  • 子数组 `[1,4,3,3,2]` ,最大元素为 4 ,第一个和最后一个元素都是 4 。
  • 子数组 `[1,4,3,3,2]` ,最大元素为 3 ,第一个和最后一个元素都是 3 。
  • 子数组 `[1,4,3,3,2]` ,最大元素为 3 ,第一个和最后一个元素都是 3 。
  • 子数组 `[1,4,3,3,2]` ,最大元素为 2 ,第一个和最后一个元素都是 2 。
  • 子数组 `[1,4,3,3,2]` ,最大元素为 3 ,第一个和最后一个元素都是 3 。

所以我们返回 6 。

示例 2:

输入:nums = [3,3,3]

输出:6

解释:

总共有 6 个子数组满足第一个元素和最后一个元素都是子数组中的最大值:

  • 子数组 `[3,3,3]` ,最大元素为 3 ,第一个和最后一个元素都是 3 。
  • 子数组 `[3,3,3]` ,最大元素为 3 ,第一个和最后一个元素都是 3 。
  • 子数组 `[3,3,3]` ,最大元素为 3 ,第一个和最后一个元素都是 3 。
  • 子数组 `[3,3,3]` ,最大元素为 3 ,第一个和最后一个元素都是 3 。
  • 子数组 `[3,3,3]` ,最大元素为 3 ,第一个和最后一个元素都是 3 。
  • 子数组 `[3,3,3]` ,最大元素为 3 ,第一个和最后一个元素都是 3 。

所以我们返回 6 。

示例 3:

输入:nums = [1]

输出:1

解释:

`nums` 中只有一个子数组 `[1]` ,最大元素为 1 ,第一个和最后一个元素都是 1 。

所以我们返回 1 。

提示:

  • `1 5`
  • `1 9`
参考解法

参考解法如下,使用单调递减栈统计每个元素作为子数组右端点时能贡献多少个合法子数组。

python
from typing import List


class Solution:
    def numberOfSubarrays(self, nums: List[int]) -> int:
        ans = 0

        # 栈中元素为 [value, count]
        # value 单调递减,count 表示当前仍然有效的、值为 value 的元素个数
        stack = []

        for x in nums:
            # 比 x 小的元素会被 x 阻断,之后不可能再作为边界最大值
            while stack and stack[-1][0] < x:
                stack.pop()

            if stack and stack[-1][0] == x:
                # 当前 x 自己形成一个长度为 1 的子数组:+1
                # 同时可以和之前所有仍有效的相同 x 配对
                ans += stack[-1][1] + 1
                stack[-1][1] += 1
            else:
                # 没有可配对的相同值,只能贡献单元素子数组
                ans += 1
                stack.append([x, 1])

        return ans
解练习分析

核心条件是:一个子数组 `[l, r]` 合法,当且仅当 `nums[l] == nums[r]`,并且区间中不存在比 `nums[l]` 更大的元素。长度为 1 的子数组一定合法。

从左到右扫描数组,考虑当前元素 `x` 作为子数组右端点:

  • 如果栈顶元素小于 `x`,这些较小值会被当前 `x` 阻断。之后即使再遇到相同的小值,中间也有一个更大的 `x`,无法作为合法子数组的两个边界,因此直接弹出。
  • 弹出后,如果栈顶值等于 `x`,说明之前这些 `x` 和当前 `x` 之间没有比 `x` 更大的元素,因此它们都可以和当前 `x` 组成合法子数组。若当前有效的相同值个数为 `cnt`,则当前元素贡献 `cnt + 1`,其中 `cnt` 是和之前相同值配对,`1` 是单元素子数组。
  • 如果栈顶值大于 `x` 或栈为空,则当前 `x` 无法和之前元素配对,只贡献单元素子数组。

栈维护的是一个从栈底到栈顶严格递减的值序列,每个值附带一个计数,表示当前仍未被更大元素阻断的相同值数量。

复杂度: - 时间复杂度:`O(n)`,每个元素最多入栈一次、出栈一次。 - 空间复杂度:`O(n)`,最坏情况下数组严格递减,栈中保存所有元素。

边界条件: - `nums.length == 1`,答案为 `1`。 - 所有元素相同,例如 `[3,3,3]`,答案为 `n * (n + 1) / 2`。 - 严格递增数组,每个新元素都会弹出前面的元素,答案为 `n`。 - 严格递减数组,没有两个相同边界能配对,答案也为 `n`。 - 答案数量可能达到 `n * (n + 1) / 2`,需要使用 64 位整数;Python 无需额外处理,Java/C++ 需要 `long long` 或 `long`。

常见错误: - 误以为只要两端都是局部最大即可,实际上两端必须都是整个子数组的最大值。 - 遇到更大元素时没有弹出较小元素,导致错误地跨越更大值配对。 - 相同值计数时只加 `1`,漏掉和之前所有相同值形成的子数组。 - 把栈维护成严格递增,方向写反。 - 忘记统计所有单元素子数组。

出练习者常见追问: - 为什么小于当前值的栈元素可以直接弹出? - 为什么相同值的贡献是 `cnt + 1`? - 如果用二分或离线分组能不能做,复杂度是多少?

评分
95/100
思路 25/25正确性 25/25复杂度 20/20工程性 15/15表达 10/15
追问
  • 如何证明每个元素最多入栈出栈一次
  • 如果用 Java/C++ 如何避免答案溢出
  • 是否可以用“上一个更大元素 + 分组二分”解决
类比
像一排人向左看,当前高个子会挡住所有更矮的人,只能和没被更高个子挡住的同身高人配对。

往期记录 144 条记录

2026年07月30日受限内存推理调度interviewLLM-servingKV-cacheScheduling
2026年07月29日技能感知词元压缩interviewTokenCompressionMultimodalKnapsack
2026年07月27日递归验证预算分配interviewAStarBanditSubmodular
2026年07月26日推理早停预算分配interviewOptimalStoppingSequentialTestCalibration
2026年07月26日二叉树中所有距离为 K 的结点codeTreeBFSDFS
2026年07月25日流式同传轨迹调度interviewStreamingMonotonicAlignmentLatencyControl
2026年07月25日分割回文串codepalindromebacktrackingdynamicprogramming
2026年07月24日最大节点价值之和codeGreedyBitManipulationTree
2026年07月23日长音视频工具调度interviewTool RoutingDAG SchedulingSubmodular Maximization
2026年07月20日流式多模态记忆检索interviewStreaming MemoryMultimodal RetrievalTemporal Indexing
2026年07月20日T 秒后青蛙的位置codeTreeDFSProbability
2026年07月20日约束预算模型路由interviewModel RoutingConstrained OptimizationContextual Bandit
2026年07月20日匹配模式数组的子数组数目 IIcodeArrayKMPStringMatching
2026年07月20日受限显存解码调度interviewLLMCompilerKVCacheScheduling
2026年07月20日填充每个节点的下一个右侧节点指针 IIcodeTreeBFSLinkedList
2026年07月02日变分信息瓶颈Information BottleneckVariational BoundRate-Distortion
2026年07月01日CTC序列对齐方法CTCForward-Backward MethodBlank Token
2026年07月01日故障流行病学Core DumpStatistical DebuggingFault Localization
2026年06月30日哈希嵌入压缩Hash EmbeddingFeature HashingEmbedding Compression
2026年06月29日一致性蒸馏Consistency ModelsProgressive DistillationODE Trajectory
2026年06月29日原生推理引擎Native RuntimeggmlInference Engine
2026年06月28日无分类器引导Classifier-Free GuidanceGuidance ScaleScore Interpolation
2026年06月25日MVDR波束成形MVDR BeamformingSpatial FilteringCovariance Estimation
2026年06月24日神经缩放定律Scaling LawsCompute-Optimal TrainingPower Law
2026年06月23日最小贝叶斯风险解码Minimum Bayes RiskDecision TheoryHypothesis Selection
2026年06月23日PID控制与生成调控PID ControllerFeedback ControlClosed-loop Generation
2026年06月22日生成模型评估度量Frechet Inception DistanceGenerative EvaluationFeature Statistics
2026年06月21日浮点量化收缩偏差FP4 TrainingShrinkage BiasLow-Precision Arithmetic
2026年06月21日模型上线仿真Deployment SimulationShadow TestingOffline Evaluation
2026年06月20日现代联想记忆Hopfield NetworkAssociative MemoryEnergy-Based Model
2026年06月19日离散扩散语言模型Discrete DiffusionAbsorbing StateConcrete Score
2026年06月18日循环变换器架构Looped TransformerWeight TyingAdaptive Computation
2026年06月17日韵律建模演进Prosody PredictionF0 ModelingDuration Prediction
2026年06月16日说话人日志Speaker DiarizationSpeaker EmbeddingEEND
2026年06月15日偏好对齐优化Preference OptimizationDPOReward Modeling
2026年06月14日多令牌并行预测Multi-Token PredictionSpeculative DecodingParallel Decoding
2026年06月13日流匹配生成模型Flow MatchingRectified FlowOptimal Transport Path
2026年06月13日实时管线延迟预算Latency BudgetPipeline OrchestrationTime-to-First-Token
2026年06月12日MoE路由机制Mixture of ExpertsSparse GatingRouter Design
2026年06月11日连续自回归生成Continuous AutoregressiveLatent PredictionAudioVAE
2026年06月10日KV缓存压缩KV Cache CompressionToken EvictionAttention Sparsity
2026年06月09日浏览器端模型推理WebGPUBrowser InferenceClient-side ML
2026年06月02日残差向量量化Residual Vector QuantizationAudio TokenizationNeural Codec
2026年05月31日彩色噪声扩散采样Colored NoiseSpectral BiasSDE Solver
2026年05月31日算子融合编译原理Kernel FusionOperator Fusiontorch.compile
2026年05月20日AI生成内容溯源 (7 chars) ✓Content ProvenanceC2PASynthID
2026年05月19日推理委托设计模式 (8 chars) ✓ Let me now write the full content for both topics. Actually, I realize I should double-check: is "Runtime Abstraction" or "Delegate Pattern" too close to any covered keyword? Looking at the list: Cluster Scheduling, Co-design, Collective Communication, Computational Expressiveness, CUTLASS... No, none of these overlap. OK, let me finalize and write everything out. Let me reconsider the engineering topic one more time. The title "推理委托设计模式" is good but maybe I should make it even more specific and interesting. What about focusing on the "graph partitioning" aspect - how ML runtimes decide which operations to delegate to which backend? This is a more specific and technically interesting angle. No, I think the broader "delegate pattern" is better because it covers the full picture and is more useful to the reader. Let me write it all out now. For the engineering topic, let me think about the history: - Early days: frameworks were monolithic (Caffe, early TensorFlow) - TensorRT (2017): NVIDIA's specialized inference engine, initially standalone - ONNX Runtime (2019): Microsoft introduced "Execution Providers" - the first major delegate-like abstraction - TFLite delegates (2018-2019): TensorFlow Lite introduced delegate API for GPU, NNAPI, etc. - ExecuTorch (2023-2024): PyTorch's answer to edge inference with a clean delegate API - 2025-2026: MLX delegate, Qualcomm AI Engine Direct delegate, etc. This is a rich history. Let me write it up. Actually, I want to make sure I have the dates right: - TensorRT was first released around 2016-2017 - ONNX was announced in 2017 - ONNX Runtime was open-sourced in 2018-2019 - TFLite was released in 2017, delegates came later - ExecuTorch was announced at PyTorch Conference 2023 OK, let me write everything now. I'll be thorough. One more thought: for the MATH section of the engineering topic, I could discuss the graph partitioning problem formally, or I could discuss the cost model for deciding whether to delegate. Let me think... The graph partitioning for delegation can be formalized as: - Given a computation graph $G = (V, E)$ where $V$ is the set of operations and $E$ is data dependencies - And a set of delegates $D = \{d_1, ..., d_m\}$ where each delegate supports a subset of operations $S_i \subseteq V$ - Find a partition $P = \{P_0, P_1, ..., P_m\}$ (where $P_0$ is the fallback/CPU partition) that minimizes total execution time - Subject to: each $
2026年05月17日连续批处理异步化
2026年05月10日连续潜在扩散语言模型Continuous Latent DiffusionNon-autoregressive LMDiffusion Language Model
2026年05月10日零样本跨语言语音克隆Zero-shot Voice CloningCross-lingual TTSIPA Phoneme Representation
2026年05月09日最优传输音频距离Optimal TransportFréchet Audio DistanceRiemannian Metric
2026年05月09日推荐系统推理核内广播优化Intra-kernel BroadcastEmbedding TableRecommendation Inference
2026年05月08日扩散Transformer异常值令牌Outlier TokensDiffusion TransformerAttention Sink
2026年05月08日WebRTC低延迟语音工程WebRTCReal-time AudioJitter Buffer
2026年05月07日音素级深度伪造检测原理Phoneme-level Deepfake DetectionSelf-supervised Speech EmbeddingEmotional Speech Synthesis
2026年05月07日AI训练网络协议工程哲学Multi-path Reliable ConnectionRDMA over EthernetCollective Communication
2026年05月05日对抗解纠缠说话人验证Speaker DisentanglementAdversarial TrainingCross-lingual Verification
2026年05月05日LLM推理为何用语言Chain-of-ThoughtLatent ReasoningToken Space
2026年05月01日跨架构知识蒸馏原理Cross-Architecture DistillationDiffusion LMAutoregressive Teacher
2026年05月01日AI评估计算瓶颈工程LLM Evaluation InfrastructureBenchmark SaturationEval Compute Bottleneck
2026年04月29日平衡传输语音增强Schrödinger BridgeStochastic Differential EquationSpeech Enhancement
2026年04月29日深度学习理论形成Deep Learning TheoryLoss LandscapeNeural Tangent Kernel
2026年04月28日语义进度函数原理Semantic Progress FunctionDiffusion TrajectoryNonlinear Denoising
2026年04月28日大模型OCR选型认知OCR BenchmarkModel Selection BiasCost-Performance Tradeoff
2026年04月27日说话人验证核心原理Speaker Verificationd-vectorECAPA-TDNN
2026年04月27日GPU核函数语言选型GPU Kernel EngineeringCuTe DSLCUTLASS
2026年04月26日时长控制TTS原理Duration ModelingProsody ControlAutoregressive TTS
2026年04月26日AI研究价值评估困境Research EvaluationPublication BiasPeer Review
2026年04月25日全双工对话建模原理Full-Duplex DialogueTurn-TakingVoice Activity Detection
2026年04月25日流式TTS文本规范化Text NormalizationStreaming TTSInverse Text Normalization
2026年04月24日离散扩散语言模型原理Discrete DiffusionMasked Diffusion Language ModelAbsorbing Diffusion
2026年04月24日跟进ML研究的认知工程Information OverloadResearch TriageSpaced Repetition
2026年04月23日一致性正则化ASR原理Consistency RegularizationUnified ASRTransducer
2026年04月23日流式TTS文本规范化工程Text NormalizationStreaming TTSInverse Text Normalization
2026年04月22日神经编码器伪影检测Neural Audio CodecArtifact DetectionForensic Residual
2026年04月22日AI研究复现危机工程Reproducibility CrisisML EngineeringExperimental Rigor
2026年04月21日扩散SNR偏差校正原理Signal-to-Noise RatioDiffusion Timestep BiasScore Matching
2026年04月21日论文复现危机根治工程Reproducibility CrisisAblation StudyExperimental Rigor
2026年04月20日音频时序定位原理Temporal GroundingAudio Event DetectionCross-modal Alignment
2026年04月20日论文复现危机根因Reproducibility CrisisBenchmark OverfittingEvaluation Validity
2026年04月19日流匹配对齐原理Flow Matching AlignmentReward Gradient BackpropagationTrajectory Optimization
2026年04月19日分布式训练任务编排Distributed Training OrchestrationCluster SchedulingFault Tolerance
2026年04月18日最优传输信号融合Optimal TransportWasserstein BarycenterTime-Frequency Resolution
2026年04月18日分布式训练任务调度Distributed Training OrchestrationJob SchedulingCluster Resource Management
2026年04月17日扩散语音识别原理Masked Diffusion Language ModelDiscrete DiffusionASR Decoding
2026年04月17日Mel尺度跨文化偏差Mel ScalePsychoacousticsCultural Bias
2026年04月16日音频水印对抗原理Audio WatermarkingSemi-FragilePsychoacoustic Masking
2026年04月16日推测解码草稿树工程Speculative DecodingDraft TreeBlock Diffusion
2026年04月15日对抗流模型原理Continuous Normalizing FlowAdversarial TrainingFlow Matching
2026年04月15日代理状态可观测性工程Agent ObservabilityDistributed TracingState Machine Debugging
2026年04月14日过程奖励模型原理Process Reward ModelStep-level SupervisionReasoning Chain
2026年04月13日离散令牌音源分离Discrete Token ModelingSource SeparationConditional Generation
2026年04月13日超算API工程哲学Distributed Training OrchestrationSupercomputer API DesignFault Tolerance
2026年04月12日信息瓶颈原理演进Information BottleneckVariational IBDisentanglement
2026年04月12日Safetensors格式工程哲学SafetensorsModel SerializationMemory-Mapped IO
2026年04月11日归一化层演进原理Layer NormalizationRMS NormalizationBatch Normalization
2026年04月11日GEMM自调优后端工程GEMM AutotuningTorchInductorCuteDSL
2026年04月10日多令牌预测原理Multi-Token PredictionSpeculative DecodingMedusa Heads
2026年04月10日ML从业者认知校准Calibration BiasCapability IllusionBenchmark Overfitting
2026年04月09日编码器-解码器LM原理Encoder-Decoder LMCross-Attention ConditioningSequence-to-Sequence
2026年04月09日torch.compile归一化优化torch.compileLayerNormRMSNorm
2026年04月08日KV缓存压缩原理KV Cache CompressionRoPE Position EncodingAttention Score Estimation
2026年04月08日音效基础模型工程Sound Effect GenerationFoundation ModelFoley Synthesis
2026年04月07日可验证奖励强化学习Verifiable RewardRLVRProcess Reward Model
2026年04月07日LLM技能退化认知机制Cognitive OffloadingSkill AtrophyDesirable Difficulty
2026年04月06日音素可解释说话人验证Phoneme-aware Speaker VerificationInterpretable BiometricsLocal Acoustic Evidence
2026年04月06日音频幻觉攻击评估Hallucination AttackAudio Language Model ReliabilityAdversarial Probing
2026年04月05日潜在空间推理原理Latent Space ReasoningContinuous RepresentationToken-Free Inference
2026年04月05日mRNA模型极低成本训练Biology Foundation ModelCross-Species TransferLow-Budget Training
2026年04月04日编码器-解码器TTS原理Encoder-Decoder TTSText ConditioningPositional Capacity
2026年04月04日大模型训练的MXFP8工程MXFP8MicroscalingMixed Precision Training
2026年04月03日在线知识蒸馏原理Online DistillationKnowledge TransferStudent-Teacher
2026年04月03日MoE专家并行调度工程Expert ParallelismMixture of ExpertsAll-to-All Communication
2026年04月02日波形潜空间扩散TTSwaveform latent diffusionnon-autoregressive TTSlatent space acoustic modeling
2026年04月02日波形隐空间扩散原理waveform latent spacediffusion TTSVAE audio codec
2026年04月02日LLM量化权重工程weight quantizationLLM compression4-bit quantization
2026年04月02日扩散语言模型离散生成Discrete DiffusionMasked Diffusion Language ModelNon-autoregressive TTS
2026年04月02日LLM后训练库工程演进RLHF engineeringPPO training stabilityreward hacking
2026年04月02日声学证据瓶颈原理Audio Evidence BottleneckAcoustic GroundingAudio Language Model
2026年04月02日状态空间模型音频建模State Space ModelMambaSelective Scan
2026年04月02日实时语音增强工程选型Real-time Speech EnhancementNoise SuppressionStreaming Inference
2026年04月02日对话上下文压缩原理Context CompressionAbstractive SummarizationCross-Attention Fusion
2026年04月02日说话人匿名化工程Speaker AnonymizationVoice ConversionStreaming Inference
2026年04月02日视听语音识别融合Audio-Visual Speech RecognitionLip ReadingViseme
2026年04月02日GPU训练吞吐加速工程MXFP8MoE TrainingExpert Parallelism
2026年04月01日熵驱动多样性生成diversity samplingtypicality biasrepulsion in latent space
2026年04月01日说话人分割工程选型speaker diarizationbenchmark methodologystreaming ASR pipeline
2026年03月31日转向检测联合建模turn-taking detectionvoice activity detectionjoint acoustic-linguistic modeling
2026年03月31日基准测试的系统性失效benchmark contaminationevaluation validityLLM judge reliability
2026年03月31日扩散模型声学生成diffusion modelscore matchingstochastic differential equation
2026年03月31日TTS开源生态竞争open-weight TTStime-to-first-audiomultilingual speech synthesis
2026年03月30日注意力机制变体演进Multi-Head AttentionGrouped Query AttentionMulti-head Latent Attention
2026年03月30日设备端语音推理架构on-device inferenceExecuTorchvoice agent pipeline
2026年03月29日混合自回归流匹配TTSautoregressive semantic tokensflow matching acoustic decoderhybrid TTS architecture
2026年03月29日NCCL超时诊断方法论NCCL watchdog timeoutdistributed training debuggingcollective communication
2026年03月29日混合架构音频表示Mambastate space modelaudio representation learning
2026年03月29日DeepSeek预训练加速工程MXFP8 trainingexpert parallelismMoE pretraining
2026年03月27日说话人验证度量学习speaker verificationmetric learningcurriculum learning
2026年03月27日MX浮点格式加速训练MXFP8microscalingmixed precision training
2026年03月26日TTS模型极限压缩model compressionknowledge distillationTTS on-device
2026年03月26日小模型极限压缩哲学model compressionknowledge distillationquantization
2026年03月25日流匹配生成原理flow matchingrectified flowODE
2026年03月25日神经音频编解码器neural audio codecresidual vector quantizationEnCodec
2026年03月25日推测解码加速推理speculative decodingdraft modeltoken verification