恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

train-sentence-transformers - evaluators_sentence_transformer

  • 首页
  • 资讯中心
  • /
  • train-sentence-transformers - evaluators_sentence_transformer

相关资讯

Keynote 技能测验逐题精解:linkedin-skill-assessments-quizzes 仓库 keynote-quiz 全量备考指南 2026/10/3 22:58:03
TVA智能体技术体系概述(14):AI智能体视觉多模态感知提升执行稳定性 2026/10/3 22:58:03
具身智能创新设计方案(53):TVA与World模型的数据闭环协同进化 2026/10/3 22:58:03

最新资讯

2026大厂测试技术栈全景拆解:从自动化到质量工程的学习路线
戴尔台式机故障灯全解读:电源LED与诊断代码定位开机故障
7.4ms极速打字决策:MLX在Apple Silicon上的端侧推理优化实践
游戏更新后闪退卡死掉帧?五步排查免重装系统
Godot 4 中用 Rust 写 GDExtension 扩展:从环境搭建到性能优化
RPCA与ADMM视频前景检测:低秩稀疏模型与Matlab实现

今日推荐

SAP生产预留实战指南:MB21/MB23/MB25协同与MRP集成
编译原理实验:递归下降分析器消除左递归与避坑指南
Python协议级爬取Shopee商品数据实战

本周热门

从像素到笔画:srt-whiteboard-animation骨架笔迹追踪实现(Zhang-Suen细化+8邻接追踪)
网站建设的英语怎么说?别只背单词,看完这套安全完整流程才敢上线
新手入门看这篇:建设网站加盟避坑指南与SEO实操

本月精选

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)

train-sentence-transformers - evaluators_sentence_transformer

发布时间:2026/10/3 23:03:04
train-sentence-transformers - evaluators_sentence_transformer 评估器双编码器所有双编码器评估器都位于sentence_transformers.sentence_transformer.evaluation中。选择合适的评估器任务评估器检索nDCG、MRR、Recall——快速默认NanoBEIREvaluator在自有语料库 / qrels 上检索InformationRetrievalEvaluatorSTS / 连续相似度EmbeddingSimilarityEvaluator二分类BinaryClassificationEvaluator三元组准确率TripletEvaluator重排来自检索候选RerankingEvaluator与教师模型的 MSE蒸馏MSEEvaluator、MSEEvaluatorFromDataFrame释义挖掘ParaphraseMiningEvaluator翻译跨语言对齐TranslationEvaluator标签准确率训练期间的分类LabelAccuracyEvaluator将多个评估器包装在SequentialEvaluator中以便一起跟踪fromsentence_transformers.sentence_transformer.evaluationimportSequentialEvaluator evaluatorSequentialEvaluator([evaluator1,evaluator2,evaluator3])三大评估器NanoBEIREvaluator检索BEIR 的小型快速子集。在中端 GPU 上典型运行时间 1 分钟。检索训练的默认选择。fromsentence_transformers.sentence_transformer.evaluationimportNanoBEIREvaluator evaluatorNanoBEIREvaluator(dataset_names[msmarco,nfcorpus,nq],# 默认全部 13 个 NanoBEIR 数据集batch_size128,show_progress_barFalse,)默认数据集列表覆盖 13 个任务训练期间选择子集以加快速度。metric_for_best_model的输出键eval_NanoBEIR_mean_cosine_ndcg10双编码器默认 余弦相似度。EmbeddingSimilarityEvaluatorSTS 风格计算模型余弦相似度与金标准标签之间的 Pearson/Spearman 相关性。fromsentence_transformers.sentence_transformer.evaluationimportEmbeddingSimilarityEvaluatorfromsentence_transformers.util.similarityimportSimilarityFunction evaluatorEmbeddingSimilarityEvaluator(sentences1stsb[sentence1],sentences2stsb[sentence2],scoresstsb[score],main_similaritySimilarityFunction.COSINE,namests-dev,)main_similarity可以是COSINE、DOT_PRODUCT、EUCLIDEAN、MANHATTAN。name用于输出键eval_sts-dev_spearman_cosine、eval_sts-dev_pearson_cosine等。InformationRetrievalEvaluator完整检索当你拥有自己的语料库 查询 qrels不是 NanoBEIR 任务之一时使用。fromsentence_transformers.sentence_transformer.evaluationimportInformationRetrievalEvaluator evaluatorInformationRetrievalEvaluator(queries{qid:query_textforqid,query_textin...},corpus{doc_id:doc_textfordoc_id,doc_textin...},relevant_docs{qid:{doc_id,...}forqidin...},# qid - 相关 doc_id 的集合namemy-retrieval,mrr_at_k[10],ndcg_at_k[10],accuracy_at_k[1,5,10],precision_recall_at_k[1,5,10],map_at_k[100],show_progress_barFalse,batch_size64,)输出键eval_{name}_cosine_ndcg10、eval_{name}_cosine_mrr10等。对大型语料库很重——每次评估都会编码整个语料库。不要每 100 步就运行它。训练期间使用NanoBEIREvaluator进行频繁评估将完整的 IR 评估保留给里程碑 / 训练后。其他双编码器评估器BinaryClassificationEvaluator用于带标签的成对分类例如重复检测、二分类蕴含。报告准确率、F1、精确率/召回率、AP。支持所有距离度量——为每个度量找到最佳阈值。TripletEvaluator用于(anchor, positive, negative)三元组。报告正例比负例更接近锚点的三元组比例。RerankingEvaluator用于自定义重排数据集你为每个查询提供候选评估器计算 MAP 和 MRR。适合衡量留出集上的检索质量。MSEEvaluator/MSEEvaluatorFromDataFrame用于蒸馏设置。比较学生嵌入与教师嵌入或教师分数报告 MSE。ParaphraseMiningEvaluator用于释义挖掘任务。给定带标签的释义对语料库计算挖掘质量各阈值下的 F1。TranslationEvaluator用于跨语言 /make_multilingual风格对齐检查。衡量学生是否跨语言对齐句子。LabelAccuracyEvaluator用于SoftmaxLoss训练的分类头。报告留出数据上的准确率。编写metric_for_best_model模式feval_{evaluator.primary_metric}。构造后检查print(evaluator.primary_metric)。常见值eval_NanoBEIR_mean_cosine_ndcg10—NanoBEIREvaluatoreval_sts-dev_spearman_cosine—EmbeddingSimilarityEvaluator(namests-dev)eval_{name}_cosine_ndcg10—InformationRetrievalEvaluator(name...)多维评估Matryoshka对于 Matryoshka 训练的模型在每个目标维度上评估per_dim_evaluators[EmbeddingSimilarityEvaluator(sentences1...,sentences2...,scores...,main_similaritySimilarityFunction.COSINE,namefsts-dev-{dim},truncate_dimdim,)fordimin[768,512,256,128,64]]evaluatorSequentialEvaluator(per_dim_evaluators,main_score_functionlambdascores:scores[0])第一个评估器的分数驱动load_best_model_at_end。陷阱训练前务必先运行一次evaluator(model)—— 预训练基线。如果训练后增量很小说明损失/数据/基座有问题。不要使用大型语料库10 万文档的InformationRetrievalEvaluator以频繁的eval_steps运行——训练期间使用NanoBEIREvaluator将完整的 IR 评估留到训练结束时。greater_is_betterTrue是默认值适合 nDCG / MRR / 准确率。

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号