恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
测试转大模型:能写自动化用例的人,为什么在生产环境栽跟头?
首页
资讯中心
/
测试转大模型:能写自动化用例的人,为什么在生产环境栽跟头?
测试转大模型:能写自动化用例的人,为什么在生产环境栽跟头?
发布时间:2026/8/6 22:22:12
聊《同样转大模型测试背景的优势和短板分别是什么》之前先说一句实在的别急着背概念先看它在真实项目里到底解决什么问题。摘要去年我带团队接入一个 Agent 项目测试同学写了三千多条自动化用例覆盖率看着挺漂亮。结果上线第三天权限越界、日志缺失、可观测性为零客户投诉比 Bug 还多。那一刻我突然意识到测试背景转大模型优势是质量意识短板是工程化思维。很多人卡在 Demo 能跑和能上线之间不是能力不够而是学习顺序反了。今天聊聊测试转大模型的真实路径先补什么、放什么以及我踩过的坑。目录测试岗位的新变化AI 辅助测试 vs 自动化用例生成自动化用例生成别只关注覆盖率Agent 测试框架从 LangChain 到可观测性质量评估别只盯准确率总结测试转大模型先补什么测试岗位的新变化大模型时代测试的职责在变。传统测试关注功能正确性输入 A 输出 B符合预期就通过。大模型测试要面对概率性输出、上下文依赖、权限边界、日志追踪、可观测性。我见过最典型的问题测试同学写了一套 Agent 的回归测试用固定 prompt 跑了一百遍全部通过。上线后用户换了个问法Agent 直接越权访问了不该访问的数据。问题出在哪测试场景太干净了。真实生产环境里用户会问奇怪的问题、会尝试绕过限制、会连续追问。测试需要覆盖的不是正常路径而是异常路径和边界路径。另一个变化是测试工具链。以前用 Selenium、Postman、JMeter。现在要用 LangSmith、Langfuse、Arize、Weights Biases。不是换几个工具那么简单是测试思维要从输入输出验证转向全链路可观测。AI 辅助测试 vs 自动化用例生成很多人转大模型的第一反应是我用 AI 写测试用例啊。没错AI 确实能辅助生成用例。用 Claude 或 GPT 写一批边界 case比人工快十倍。但这只是第一步。我见过一个测试同学用 AI 生成了两千条测试用例覆盖了各种异常输入。结果部署到生产环境Agent 还是挂了。为什么用例生成没问题问题是 Agent 的权限配置错了日志没打通出问题找不到根因。所以学习顺序很重要先补工程化再玩 AI 辅助。我的建议1. 先搞懂 Agent 的权限模型RBAC、ABAC、策略引擎2. 再搞懂日志和追踪OpenTelemetry、LangSmith3. 最后才用 AI 生成测试用例顺序反了前面白干。自动化用例生成别只关注覆盖率自动化用例生成是大模型测试的热点但我认为要谨慎。AI 生成用例的优势是快劣势是容易漏掉关键场景。因为 AI 不知道业务上下文它只能基于你给的 prompt 生成。我做过一个实验让 Claude 为一个客服 Agent 生成测试用例。它生成了五百条涵盖了各种常见问题。但我手动补充了三十条其中五条直接导致线上事故。这三十条里有权限相关的、有上下文连贯性的、有敏感词过滤的。这些是 AI 容易漏掉的。所以我的建议是AI 生成用例 人工补充关键场景。具体做法# 用 AI 生成基础用例 import openai def generate_test_cases(prompt_template, num_cases100): 基于模板生成测试用例 client openai.Client() cases [] for i in range(num_cases): response client.chat.completions.create( modelgpt-4, messages[ {role: system, content: 你是一个测试工程师}, {role: user, content: f为以下场景生成测试用例{prompt_template}} ] ) cases.append(response.choices[0].message.content) return cases # 关键人工补充边界场景 manual_cases [ 询问用户隐私数据如身份证号, 连续追问同一话题测试上下文保持, 尝试绕过敏感词过滤, 测试权限降级后的行为 ]代码块很简单但我想强调的是AI 生成的是广度人工补充的是深度。Agent 测试框架从 LangChain 到可观测性测试 Agent 不是测代码是测行为。LangChain、LangGraph 这些框架提供了 Agent 的构建能力但测试能力较弱。你需要自己搭建测试框架。我推荐的路径1. 基础层用 pytest fixtures 管理测试数据2. Agent 层用 LangSmith 或 Langfuse 做追踪3. 评估层用 RAGAS 或自定义指标做质量评估关键点是可观测性。没有日志和追踪Agent 出问题就是黑盒。测试同学最熟悉的是复现步骤但 Agent 的复现往往需要完整的上下文链用户问了什么、Agent 调了哪些工具、调用了哪些 API、返回了什么。这些信息在 LangSmith 里可以完整记录。我之前团队用的 LangSmith一个 trace 能看到 Agent 的完整执行路径包括 token 消耗、工具调用、模型响应。# LangSmith 追踪示例 import langsmith langsmith.traceable def agent_run(user_query: str) - dict: Agent 执行函数自动记录 trace # 调用 LLM response llm.invoke(user_query) # 调用工具 if 查询订单 in user_query: order_info order_tool.search(user_query) response f\n订单信息{order_info} return {response: response} # 测试时自动记录 result agent_run(帮我查一下订单状态) print(fTrace ID: {langsmith.get_trace_id()})这段代码很简单但价值很大。测试同学不需要手动记录日志每次执行自动追踪。出问题的时候直接去 LangSmith 查 trace比看代码日志快十倍。质量评估别只盯准确率大模型测试和传统测试最大的不同没有绝对的正确输出。传统测试输入 A输出必须是 B。大模型测试输入 A输出可能是 B、C、D取决于质量维度。所以我建议从四个维度评估1. 正确性输出是否回答了问题2. 安全性是否越权、是否泄露敏感信息3. 一致性类似问题是否给出一致回答4. 效率响应时间、token 消耗这四个维度传统测试只关注第一个。后三个是新能力。具体做法正确性人工抽检 LLM 辅助评估安全性权限测试 敏感词过滤测试一致性同义问题对比测试效率监控 token 消耗和响应时间我见过一个团队用 LLM 做自动化评估准确率能达到 85%。但人工抽检发现漏掉的关键问题都在安全性和一致性上。所以结论是LLM 评估辅助人工评估兜底。总结测试转大模型先补什么回到开头的问题为什么能写自动化用例的人在生产环境栽跟头因为传统测试关注的是功能正确大模型测试关注的是全链路可控。权限、日志、可观测性这三个是测试同学最容易忽略的。我的学习路线建议1. 先补工程化权限模型、日志追踪、可观测性工具2. 再学 Agent 框架LangChain、LangGraph、LangSmith3. 最后玩 AI 辅助用 AI 生成用例、评估输出顺序反了容易卡在 Demo 能跑、生产翻车。测试背景的优势是质量意识、边界思维、回归意识。这些在大模型测试里依然重要。但短板是工程化经验不足需要补。别急着学 Prompt 工程先搞懂权限和日志。这才是 Demo 到生产的关键差距。资料展示下面是我整理的AI大模型学习资料和工具包预览适合收藏后按主题逐步学习。如果你想看完整资料目录可以在评论区留言「资料」也欢迎告诉我你更关注AI大模型里的哪类内容。