恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

DeepEval 怎么评估 MCP 应用的单轮与多轮工具使用场景

  • 首页
  • 资讯中心
  • /
  • DeepEval 怎么评估 MCP 应用的单轮与多轮工具使用场景

相关资讯

Memvid 单文件 AI 记忆层深度指南:.mv2 格式、智能帧与 Rust 实战 2026/9/14 8:53:28
Krokiet 完整指南:一款免费离线运行的开源磁盘清理工具 2026/9/14 8:53:28
Dozzle:面向 Docker、Swarm 与 K8s 的实时容器日志查看器 2026/9/14 8:53:28

最新资讯

ESP32蓝牙Beacon高精度测距实战:RSSI滤波与路径损耗建模
AI建站工具怎么选?一套决策框架拆解We0、ChatGPT Sites、Lovable与Bolt
2026具身智能培训避坑指南:从VLA到真机实操的选课核心指标
具身智能数据采集平台选型实战:从人机交互需求到系统搭建
无人机集群智能飞行:RRT算法优化与V型编队控制
C++快速排序深度解析:从分区函数到三路划分与性能优化

今日推荐

ASP+Access库存管理系统源码部署与IIS配置实战指南
基于SSM框架的毕业季旧物分类处理系统设计与实现
MATLAB FFT频谱仿真:从DFT原理到参数设置与窗函数选择

本周热门

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化
Flutter应用改名全指南:从Android到iOS的配置与工具实践

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

DeepEval 怎么评估 MCP 应用的单轮与多轮工具使用场景

发布时间:2026/9/14 8:58:28
DeepEval 怎么评估 MCP 应用的单轮与多轮工具使用场景 DeepEval 怎么评估 MCP 应用的单轮与多轮工具使用场景【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval如果你的应用基于 MCPModel Context Protocol工作——一个 Host 通过 Client 连接 MCP Server、调用其中的 tools / resources / prompts——你想知道它是否选对了工具、传对了参数、并最终完成了任务就可以用deepeval的 MCP 指标来评估。做法分三步在应用运行时跟踪所有 MCP 交互在应用执行之后据此创建测试用例然后用 LLM 评判指标跑evaluate()。单轮场景用LLMTestCaseMCPUseMetric多轮会话场景用ConversationalTestCaseMultiTurnMCPUseMetric/MCPTaskCompletionMetric。本文以 Python SDK 为主路径文档中的示例即 PythonTypeScript 分支在各节末尾给出。准备条件按 MCP Evaluation Quickstart/getting-started-mcp.mdx) 的要求你需要安装deepeval、一个 MCP 客户端以及你的 Host 实际调用的 LLM SDK。Quickstart 的示例应用通过 streamable HTTP 连接服务器并调用 Anthropicpip install -U deepeval mcp anthropicTypeScript 环境npm install --save-dev deepeval npm install modelcontextprotocol/sdk anthropic-ai/sdk其余前置条件评判模型MCP 指标都是 LLM-as-a-judge默认使用 OpenAI需在 CLI 中提供OPENAI_API_KEY。也可以换成任何deepeval支持的模型如deepeval set-ollama、deepeval set-gemini或传入自定义DeepEvalBaseLLM实例配置方式见 configure-llm-judge。Confident AI API key推荐用于在 Confident AI 平台查看和分享测试报告在 CLI 中设置CONFIDENT_API_KEY文档示例值为confident_us...替换成你注册得到的实际 key。一个可访问的 MCP 服务器Host 应用已经能连上它并list_tools()。单轮与多轮怎么选两种路径跟踪的是同一类运行时交互tools_called、resources_called、prompts_called区别在数据落到哪里单轮多轮测试用例LLMTestCase一个input/actual_outputConversationalTestCase多个TurnMCP 调用记录位置用例顶层的mcp_tools_called等字段每个Turn内部不是顶层指标MCPUseMetricMultiTurnMCPUseMetric、MCPTaskCompletionMetricMCPUseMetric的 FAQ/metrics-mcp-use.mdx) 明确了这一选择标准单个input/actual_output用MCPUseMetric跨会话的工具使用用MultiTurnMCPUseMetric。单轮评估跟踪交互并构建 LLMTestCase创建 MCPServer 对象连接你的 MCP 服务器把list_tools()的结果作为available_tools存入MCPServer评估时指标需要用它知道有哪些原语可用# main.py from contextlib import AsyncExitStack from mcp import ClientSession from mcp.client.streamable_http import streamablehttp_client from deepeval.test_case import MCPServer url https://example.com/mcp # 替换为你自己的 MCP 服务器地址streamable-http 传输 mcp_servers [] async def connect(): stack AsyncExitStack() read, write, _ await stack.enter_async_context(streamablehttp_client(url)) session await stack.enter_async_context(ClientSession(read, write)) await session.initialize() tool_list await session.list_tools() mcp_servers.append(MCPServer( server_nameurl, transportstreamable-http, available_toolstool_list.tools, )) return session, tool_listTypeScript 分支new MCPServer({ serverName: url, transport: streamable-http, availableTools: toolList.tools })。跟踪工具调用Host 每次通过 LLM 决定调用工具并执行后把这次调用记成MCPToolCall。下面是文档示例的调用链把可用工具转成 Anthropic 的 tools 格式调messages.create对返回中的每个tool_use块执行session.call_tool并记录模型名claude-3-5-sonnet-20241022来自文档示例from anthropic import Anthropic from deepeval.test_case import MCPToolCall tools_called [] client Anthropic() async def process_query(session, tool_list, query): available_tools [ {name: t.name, description: t.description, input_schema: t.inputSchema} for t in tool_list.tools ] response client.messages.create( modelclaude-3-5-sonnet-20241022, max_tokens1000, messages[{role: user, content: query}], toolsavailable_tools, ) response_text [] for content in response.content: if content.type text: response_text.append(content.text) elif content.type tool_use: result await session.call_tool(content.name, content.input) tools_called.append(MCPToolCall( namecontent.name, argscontent.input, resultresult, )) return \n.join(response_text)如果你还使用了 MCP 的 resources 或 prompts同样要跟踪resources_called/prompts_calledMCPUseMetric 文档/metrics-mcp-use.mdx) 说明只要用到就必须提供否则指标无法完整评估。构建测试用例并运行评估测试用例必须在应用执行完之后创建。MCPUseMetric的必填字段是input、actual_output、mcp_servers再加上实际调用过的原语from deepeval.test_case import LLMTestCase from deepeval.metrics import MCPUseMetric from deepeval import evaluate test_case LLMTestCase( inputquery, actual_outputresponse, mcp_serversmcp_servers, mcp_tools_calledtools_called, ) metric MCPUseMetric() evaluate([test_case], [metric])仓库中有一个可直接运行的完整单轮示例mcp_eval_single_turn.pystreamable HTTP Anthropic交互式chat_loop退出时打印构建好的LLMTestCase。Quickstart 的建议是让你的main()返回跟踪到的 servers 和 interactions方便在不同测试文件中复用。验证结果evaluate()会把所有指标跑在所有测试用例上每个指标输出0-1的分数threshold默认0.5。也可以单独跑一次用于调试metric.measure(test_case) print(metric.score, metric.reason)注意单独measure()没有evaluate()/deepeval test run的测试报告、缓存与并发优化只适合调试或自建评估管线。设置过CONFIDENT_API_KEY后test run 会自动出现在 Confident AI没有登录时也可以从本地缓存上传deepeval viewTypeScript 为npx deepeval view。多轮评估把 MCP 交互挂到 Turn 上多轮的关键区别mcp_tools_called、mcp_resources_called、mcp_prompts_called要加在每个 assistantTurn对象内部而不是ConversationalTestCase的顶层Multi-Turn MCP-Use FAQ/metrics-multi-turn-mcp-use.mdx) 专门强调了这一点。跟踪阶段与单轮类似但每发生一次工具调用就往turns里追加一个带mcp_tools_called的 assistantTurnfrom deepeval.test_case import MCPToolCall, Turn, ConversationalTestCase turns [] # 用户每发一条 query turns.append(Turn(roleuser, contentquery)) # 每次 assistant 调用工具后 result await session.call_tool(tool_name, tool_args) tool_called MCPToolCall(nametool_name, argstool_args, resultresult) turns.append( Turn( roleassistant, contentfTool call: {tool_name} with args {tool_args}, mcp_tools_called[tool_called], ) )assistant 的文本回复也各追加一个Turn(roleassistant, content...)见 mcp_eval_multi_turn.py该示例通过 stdio 传输连接本地.py/.js服务器脚本适合你自写 MCP server 的场景。会话结束后再创建用例——同样必须在应用执行完之后convo_test_case ConversationalTestCase( turnsturns, mcp_serversmcp_servers, )定义指标并运行多轮 MCP 评估支持两个指标Quickstart/getting-started-mcp.mdx) 建议一起用from deepeval.metrics import MultiTurnMCPUseMetric, MCPTaskCompletionMetric from deepeval import evaluate mcp_use_metric MultiTurnMCPUseMetric() mcp_task_completion MCPTaskCompletionMetric() evaluate([convo_test_case], [mcp_use_metric, mcp_task_completion])两者分工不同MCP Task Completion FAQ/metrics-mcp-task-completion.mdx)MCPTaskCompletionMetric评的是结果任务是否完成MultiTurnMCPUseMetric评的是过程原语与参数选择——工具用得再对也可能没完成目标所以是互补关系。验证方式与单轮相同分数0-1、threshold默认0.5可单独metric.measure(convo_test_case)后打印metric.score与metric.reason或通过 Confident AI /deepeval view查看完整报告。读懂分数与排查低分分数含义以各指标文档的公式为准MCPUseMetricMCP Use Score AlignmentScore(Primitives Used, Primitives Available)由评判模型根据调用了哪些原语及其参数相对于用户输入是否恰当打分。如果一次原语都没调用指标会评判调用任何一个可用原语是否会更好即评判完全不用 MCP这个决定本身。MultiTurnMCPUseMetricAlignmentScore / 总 MCP 交互次数。分母是所有交互所以每次多出来的调用都被同一标准衡量——多余或低质量的调用会拉低平均分。MCPTaskCompletionMetric各交互中完成任务数 / 总交互数。它把 turns 拆成一个个 unit interaction 逐个用 LLM 判断且是 self-explaining 指标会输出reason。排查时文档给出的路径单轮分数低AlignmentScore低意味着选了不合适的原语或参数不对。打开verbose_modeTrue默认False会把计算中间步骤打印到控制台或直接读metric.reason评判模型会给出更优选择的理由。多轮分数低某一个坏调用拉低平均分时同样开verbose_mode查看每次交互的推理定位是哪一轮的问题MCPTaskCompletionMetric保持include_reasonTrue默认值可以看到具体哪个交互被判为未完成。想更严格时调整threshold可设成None进入 score-only 模式或设strict_modeTrue强制二元打分1 为完美否则 0并覆盖 threshold 为 1。关于单轮打分过程有一处文档表述差异Quickstart/getting-started-mcp.mdx) 描述MCPUseMetric先评 primitive usage、再评 argument correctness、取两者最小值作为最终分数而 metrics-mcp-use/metrics-mcp-use.mdx) 页给出的公式是单一的AlignmentScore。以指标文档的公式为准Quickstart 的表述可理解为该对齐打分内部同时考察了原语选择与参数正确性。限制与下一步本文主路径是 streamable HTTP 传输 Anthropic HostQuickstart 的设定stdio 传输、其他 LLM SDK 的接入方式见两个完整示例文件。MCP 指标评判默认依赖 OpenAI换用自定义模型时文档提示无法保证评估行为完全符合预期因为评估需要较强的指令遵循与 JSON 输出能力。文档给出的后续动作按用例收紧threshold没有数据集时先用 golden synthesizer 生成输入存为 goldens如果自建了 MCP server可以在工具定义上配置 tracing对每次工具调用做 span 级评估。【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号