Representation learning, retrieval, semantic matching, and embedding model research.
2Papers
7Resource links
2025.06Latest month
2 papers
Featured
2025.06Embeddings
Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models
This paper introduces Qwen3 Embedding, a family of text embedding and reranking models built on Qwen3 foundation models with a multi-stage training pipeline, model merging, and LLM-synthesized multilingual data. The series covers 0.6B, 4B, and 8B sizes and achieves state-of-the-art results across multilingual embedding, retrieval, reranking, code retrieval, and cross-lingual benchmarks.
CoQuIR: A Comprehensive Benchmark for Code Quality-Aware Information Retrieval
This paper introduces CoQuIR, the first large-scale multilingual benchmark for quality-aware code retrieval, with 42,725 queries and 134,907 snippets annotated for correctness, efficiency, security, and maintainability. Its two quality-centric metrics and evaluation of 23 retrievers expose major quality-awareness gaps, while contrastive training improves quality-aware retrieval without sacrificing semantic relevance.