Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models
该论文提出 Qwen3 Embedding,一个基于 Qwen3 基础模型构建的文本嵌入与重排序模型系列,结合多阶段训练、模型合并和 LLM 合成的多语言数据。该系列覆盖 0.6B、4B 和 8B 规模,并在多语言嵌入、检索、重排序、代码检索和跨语言检索基准上取得领先表现。
研究分类
面向检索、语义匹配、表示学习和嵌入模型训练的研究。
2 篇论文
该论文提出 Qwen3 Embedding,一个基于 Qwen3 基础模型构建的文本嵌入与重排序模型系列,结合多阶段训练、模型合并和 LLM 合成的多语言数据。该系列覆盖 0.6B、4B 和 8B 规模,并在多语言嵌入、检索、重排序、代码检索和跨语言检索基准上取得领先表现。
该论文提出 CoQuIR,首个面向代码质量感知检索的大规模多语言基准,包含 42,725 个查询和 134,907 个代码片段,并从正确性、效率、安全性与可维护性四个维度进行标注。其两项质量中心指标及对 23 个检索器的评测揭示了显著的质量感知缺口,而对比训练可在不牺牲语义相关性的前提下提升质量感知检索能力。