Qwen3-Reranker

开源权重 · 通义 Qwen ·

Open weights2026 SOTA*GPU recommended

Qwen3-Reranker 家族(0.6B / 4B / 8B)是 2026 开源重排序主线:多语言、偏长上下文,常居社区开源榜前列。公开 MTEB-R / BEIR 类数字仅作方向性参考 —— 替换 bge 或托管 API 前务必用自有标注验证。

模型变体

模型规模最适合
Qwen/Qwen3-Reranker-0.6B~0.6B最轻量;仍建议 GPU
Qwen/Qwen3-Reranker-4B~4B质量优先时的默认自建选择
Qwen/Qwen3-Reranker-8B~8B开源质量顶配;VRAM / 延迟最高

建议:单卡现代 GPU 从 4B 起步。内存紧再降 0.6B;仅当标注评测显示明确 NDCG 收益时再上 8B。

分数与诚实说明

公开文章常报中大型 Qwen3 在 MTEB-R / 多语言 rerank 套件约 ~70+,8B 居开源榜前列。这些数字不能保证与表中 bge(~60)、mxbai(~62)的经典 BEIR 18 数据集均值同协议。

快速上手

Hugging Face / transformers

# Check the model card for the recommended stack (transformers / vLLM / SGLang).
# IDs (examples):
#   Qwen/Qwen3-Reranker-0.6B
#   Qwen/Qwen3-Reranker-4B
#   Qwen/Qwen3-Reranker-8B

from sentence_transformers import CrossEncoder  # if card supports CE API

# Prefer the loading recipe on the official model card — Qwen3 may use
# a chat-style scoring template rather than a plain CrossEncoder pair.
model_id = "Qwen/Qwen3-Reranker-4B"
# model = CrossEncoder(model_id, max_length=8192)  # only if supported
# scores = model.predict([(query, d) for d in docs])

生产服务常见 vLLM / OpenAI 兼容 /v1/rerank。务必按当前 Qwen 文档使用正确 prompt 模板 —— 模板错了会静默毁掉质量。

在 RAG 流水线中

# Pseudocode — same two-stage pattern as any cross-encoder
candidates = vector_db.search(query, top_k=80)   # or hybrid
scores = qwen3_rerank(query, candidates)         # official template
top = sorted(zip(scores, candidates), reverse=True)[:8]
answer = llm.complete(context=top, query=query)

何时选 Qwen3

优缺点

优点

  • 2026 开源叙事领先(0.6B–8B 阶梯)
  • 多语言 + 长上下文定位强
  • 自托管后零按次成本
  • 生态活跃(HF、vLLM、社区方案)

缺点

  • 舒适运行需要 GPU(或强量化)
  • 打分模板 / 服务栈比 MiniLM 更绕
  • 公开榜数字与经典 BEIR 均值非 1:1
  • 体量过大,无法进本站浏览器 Demo

先在你的数据上对比

用浏览器小模型建立 rerank 直觉,再在 30 条标注上 A/B Qwen3-4B vs bge-v2-m3。

打开 Demo → 评测指南 →

其他模型