← 返回首页 论文精读[AI 辅助]

五月论文精读:排序、训练与召回的五篇论文

五篇论文精读:CrossDistil 跨任务蒸馏、DMT 拓扑感知训练、增强双塔、DHEN 转化率预测与 UniNote 多模态检索。

AI 辅助整理的阅读笔记,尚未逐条对照原论文核实,如有错误欢迎指正。

整理: Chris Yan | 日期: 2026-06-05 | 论文数量: 5 篇


论文索引

#论文来源核心主题
1CrossDistil: Cross-Task Knowledge Distillation in MTLAAAI 2022 (上交/腾讯)多任务学习中的跨任务知识蒸馏
2Disaggregated Multi-Tower (DMT)MLSys 2024 (Meta/Nvidia)拓扑感知的大规模推荐模型训练
3Enhanced Twin-Tower with Interaction & Ranking LossElectronics 2025 (西安理工)双塔模型的早期交互与排序优化
4DHEN for Ad CVR PredictionWWW Companion 2025 (Pinterest)深度层次化集成网络用于转化率预测
5UniNote: Unified Embedding for Multimodal I2IKDD 2026 (小红书)多模态统一 embedding + RL reranking

Paper 1: CrossDistil — 跨任务知识蒸馏

核心问题

多任务学习(MTL)中,不同 task 的 prediction 可能包含互补的 ranking 信息,但直接用一个 task 的 soft label 教另一个 task 会导致 task conflict(不同 task 对同一 item 的排序可能矛盾)。

方法

graph TB
    subgraph CrossDistil["CrossDistil Framework"]
        AUG["1. Task Augmentation<br/>引入辅助 ranking task<br/>用 quadruplet loss 学习<br/>细粒度排序关系"]
        CAL["2. Calibrated KD<br/>Platt Scaling 校准<br/>对齐不同 task 的<br/>prediction 幅度"]
        ERR["3. Error Correction<br/>clamp 错误 teacher 预测<br/>加速收敛"]
    end

    AUG --> CAL --> ERR

三大创新:

  1. Augmented Ranking Tasks — 把 (pos_A, neg_A, pos_B, neg_B) 四元组构造成辅助排序任务,避免直接跨任务蒸馏导致的排序冲突
  2. Calibrated Distillation — 用 Platt Scaling (r̃ = P·r + Q) 对齐 teacher 的 logit 幅度后再做 KD,消除不同 task 正样本比例差异导致的偏差
  3. Error Correction — 当 teacher 预测与 hard label 矛盾时,clamp logit 值,避免早期 teacher 不准时误导 student

关键结论

  • 在 TikTok 和微信数据集上,CrossDistil 在所有 MTL baseline (Shared-Bottom, Cross-Stitch, MMoE, PLE) 上都取得了最好的 AUC 和 Multi-AUC
  • Auxiliary ranking 比 calibration 和 error correction 的贡献更大
  • 跨任务直接 KD(不用 augmented task)反而会导致性能下降

工业实践启示

在工业双塔召回模型中,在 sequence encoder 与 item embedding 之间加一个辅助 alignment loss,是增加监督信号的常见做法,本质上也是一种跨模块的知识传递。CrossDistil 的 calibration 思路提示:施加 cosine penalty 之前,应先检查两侧 embedding 的 scale 是否一致,否则直接对齐可能有偏差。


Paper 2: Disaggregated Multi-Tower (DMT) — 拓扑感知训练

核心问题

推荐模型训练中,embedding AlltoAll 通信占了 27.5% 的训练时间(Figure 1)。根本原因是模型架构(flat, 全局交互)与数据中心拓扑(层次化,intra-host NVLink » inter-host RDMA)的 不匹配。

方法

graph TB
    subgraph DMT["Disaggregated Multi-Tower"]
        SPTT["1. SPTT (语义保持塔变换)<br/>将全局 embedding 分配<br/>拆解为局部 tower<br/>利用 host 内 NVLink"]
        TM["2. Tower Module<br/>tower 内做层次化<br/>feature interaction<br/>压缩跨 host 通信量"]
        TP["3. Tower Partitioner<br/>学习 feature 分组<br/>语义相近的放同一 tower<br/>+ 负载均衡"]
    end

    SPTT --> TM --> TP

核心思想:把单一的 flat 模型拆成多个 tower,每个 tower 对应一组语义相关的 feature,部署在同一个 host 内。tower 内用 NVLink 高速通信,tower 间只在必要时做跨 host AlltoAll。

关键数据

指标结果
训练加速最高 1.9× (64 H100 GPUs)
AUC 影响无损(在 DLRM、DCN 上)
通信减少Tower Module 压缩比可达 16×
适用规模16 ~ 512 GPUs,跨 V100/A100/H100 三代

工业实践启示

对于 sparse feature 数量庞大的推荐模型,如果要 scale 到更多 GPU,DMT 的 SPTT + Tower Module 方案可以直接应用 — 把 sparse feature 按语义分组,用 Tower Partitioner 自动划分,降低训练通信开销。


Paper 3: Enhanced Twin-Tower — 早期交互 + 排序 Loss

核心问题

传统双塔模型的两个限制:(1) query 和 document 编码完全独立,缺乏早期交互;(2) 训练用绝对 similarity score 做 loss,容易过拟合到特定距离阈值。

方法

graph TB
    subgraph Model["Enhanced Twin-Tower"]
        EARLY["Early Interaction Layer<br/>document 编码时注入<br/>query pseudo-representation<br/>(cross-attention)"]
        RANK["Ranking-Optimized Loss<br/>temperature-scaled<br/>contrastive loss<br/>优化相对排序而非绝对距离"]
    end

    EARLY --> RANK

两个改进:

  1. Early Interaction — 在 document encoder 中加入 cross-attention,从 document 内容生成 pseudo-query representation,让 document embedding 在编码阶段就包含 query 信息。MRR 提升 9.2%
  2. Ranking-Optimized Loss — temperature-scaled contrastive loss 关注相对排序而非绝对相似度分数,对标签噪声更鲁棒。F1 提升 14.6%

关键结论

  • 在 NQ/TQA/WQ 三个 QA 数据集上,比 BM25 提升 20.3% Top-20 accuracy
  • 推理延迟仅 17ms(检索 1K 候选),与 DPR 相当
  • 两个组件有协同效应,联合使用比单独使用效果更好

工业实践启示

思路和推荐模型中用户行为序列 encoder 里的 cross-attention 类似 — 都是在编码阶段就引入 query-side 信息。但这篇是在 NLP 检索场景,而非推荐场景。推荐中直接优化 embedding 对齐(而非只做 softmax CE)的辅助 loss,也可以看作一种 ranking-aware loss。


Paper 4: DHEN for CVR — Pinterest 的转化率预测实践

核心问题

CVR 预测面临三大挑战:(1) 标签极度稀疏(比 CTR 少几个数量级);(2) 标签延迟(off-site 转化有延迟);(3) 标签噪声(归因不精确)。

方法

graph TB
    subgraph DHEN_CVR["DHEN for CVR"]
        MTL["Multi-Task Learning<br/>CTR + 多种 CVR task 联合训练<br/>CTR head 提供大量训练信号"]
        
        subgraph Architecture["2-Layer DHEN"]
            L1["Layer 1: MLP + Transformer"]
            L2["Layer 2: MLP + MaskNet"]
            L1 --> L2
        end
        
        SEQ["Sequence Modeling<br/>5 类行为序列<br/>(search, organic, ads,<br/>matched conv, attributed conv)"]
        SSL["Self-Supervised Loss<br/>预测序列中的未来行为<br/>(Next Action Loss)<br/>缓解标签稀疏"]
        PARETO["ParetoNet Search<br/>性能-吞吐量<br/>Pareto 最优搜索"]
    end

关键设计决策:

决策选择原因
Feature CrossingDHEN (ensemble of MLP+DCN+MaskNet+Transformer)比单一模块好,2 层最优
多任务CTR + 多种 CVR 联合CTR head 提供海量标签做 regularization
序列类型5 种分开而非合并分开比合并效果好
Self-supervisedNext Action Loss (NAL)比 MLM 好,预测未来比预测中间好
User feature序列 > pre-trained embedding > counting > categorical > demographic序列特征贡献最大

线上效果

指标变化显著性
CPA-2.15%✅
iCVR+4.90%✅
#Conversion+1.62%✅
Overall CTR-2.70%✅

重要发现:CTR 下降但 CVR 上升 — 说明模型更精准地找到了真正会转化的用户,而不是只追求点击。

工业实践启示

Pinterest 的 DHEN 架构是多种 feature crossing module 的 ensemble。其 self-supervised next action loss 解决的问题是:给 sequence encoder 额外的监督信号。常见的另一种做法是 cosine alignment,而他们用 InfoNCE 做 next-item prediction。另外,他们发现序列特征比 pre-trained embedding 更重要 — 说明在 sequence encoder 上的投入方向是对的。


Paper 5: UniNote — 统一 Embedding + RL Reranking

核心问题

工业级 I2I (Item-to-Item) 检索面临三个问题:(1) 全局表征与局部检索的粒度失配;(2) embedding 和 ranking pipeline 割裂(先检索再重排,效率低);(3) 多模态内容(文本+图片+视频+OCR)的异构融合。

方法

graph TB
    subgraph UniNote["UniNote: 两阶段训练"]
        subgraph Stage1["Stage 1: Contrastive SFT"]
            DATA["10 种 I2I 检索任务<br/>+ multi-granularity<br/>hard negative mining"]
            MLLM["Qwen3VL-8B → embedding<br/>last token as representation<br/>+ MRL (64/512/1024/4096)"]
            LOSS1["JS Divergence<br/>(embedding dist vs MLLM soft label)"]
        end

        subgraph Stage2["Stage 2: RL Reranking (GRPO)"]
            REWARD["Hierarchical Reward:<br/>1. Irrelevant Note Penalty<br/>2. Base Relevant Reward<br/>3. Absolute Position Reward<br/>4. Relative Order Reward"]
            GRPO["GRPO optimization<br/>directly on embedding space"]
        end
    end

    Stage1 --> Stage2

核心创新:

  1. 统一检索-排序框架 — 传统方案是 embedding model (retrieval) + reranker (ranking) 两个模型。UniNote 用一个模型同时做 retrieval 和 ranking,通过 RL 阶段让 embedding space 直接具备 ranking 能力
  2. Contrastive SFT — 把 MLLM 变成 embedding model(取 last token),用 JS divergence 对齐 embedding 距离分布和 MLLM soft label 分布。配合 MRL 支持多维度部署
  3. GRPO Reranking — 用 4 维度层次化 reward 做 RL 训练,直接优化 embedding 空间的排序质量。不需要单独的 reranker 模型
  4. Hard Negative Mining — 三级策略:similarity-based (全局候选池) + rule-based (同 note 内不同 element 互为 neg) + counterfactual (替换部分内容)

关键结果

任务UniNote R@1最强 baseline R@1提升
Subordinate Retrieval (I2Note)93.761.1 (Qwen3VL)+32.6
Subordinate Retrieval (T2Note)53.139.6 (Qwen3VL)+13.5
Semantic Extraction (Note2I)90.280.8 (Qwen3VL)+9.4
Content Relevance (Note2Note)15.915.8 (RzenEmbed)+0.1

工业实践启示

这篇和 VLM embedding 方向高度相关。几个直接可借鉴的点:

  1. MRL — 用 Matryoshka Loss 支持多维度部署
  2. GRPO for ranking — 用 RL 直接优化 embedding 空间的排序质量,不需要单独的 reranker。只用 contrastive learning 训练的检索模型,可以考虑加 RL 阶段
  3. Hard negative mining 三级策略 — 相比只用 in-batch negatives,可以试 similarity-based + rule-based + counterfactual
  4. JS divergence vs cosine penalty — UniNote 用 JS divergence 对齐两个分布(embedding vs MLLM soft label),比直接用 cosine penalty 更 principled

跨论文横向对比

主题:如何给 embedding/sequence model 额外的监督信号

论文方法Loss 类型效果
CrossDistil跨任务 soft label 蒸馏Calibrated KD (CE)AUC +0.3~0.5%
DHEN (Pinterest)Next Action Loss (序列预测)InfoNCEPR-AUC +2.18%
UniNote (小红书)GRPO RL rerankingHierarchical rewardR@5 +1.4%

主题:大规模推荐模型的效率优化

论文优化层面方法加速比
DMT (Meta)训练通信SPTT + Tower Module1.9×
DHEN (Pinterest)模型选择ParetoNet (AUC vs 吞吐量)Pareto 最优
UniNote (小红书)部署灵活性MRL (64/512/1024/4096)存储/检索灵活

对工业推荐系统的启发

启发来源适用场景
RL 阶段优化 embedding rankingUniNote (GRPO)检索模型的排序质量,省去单独的 reranker
多级 hard negative miningUniNote只用 in-batch negatives 的对比学习检索模型,可加 similarity + counterfactual
Calibrated KD 校准跨 task 信号CrossDistil跨模块 alignment loss 的 scale 对齐
Self-supervised next action lossDHENsequence encoder 的额外监督信号
Tower Partitioner 自动 feature 分组DMT大规模 sparse feature 模型的多 GPU 训练
ParetoNet 超参搜索DHEN在 AUC 与吞吐量之间选择 MLP 配置
推荐系统多任务学习分布式训练向量召回
← 全部文章Read in English →