恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

SenseNova sn-infographic 提示词质量评估标准详解:R01–R08 必答项与 O01–O12 选答项实战指南

  • 首页
  • 资讯中心
  • /
  • SenseNova sn-infographic 提示词质量评估标准详解:R01–R08 必答项与 O01–O12 选答项实战指南

相关资讯

回溯算法入门:从决策树到剪枝,掌握递归模板与经典题型 2026/10/12 6:49:09
C++最佳实践:用const、enum、inline替代#define的深度解析 2026/10/12 6:49:09
回溯法入门:从递归穷举到剪枝优化的完整指南 2026/10/12 6:49:09

最新资讯

artcraft解析:AI生成结合手工编辑,打造从创意到成品的顺畅设计流
自建最小物联网平台:从MQTT接入到Android端查看的完整实战
artcraft创意工作流:从素材管理到批量输出的完整方法论
热等静压HIP工艺全解析:解决铸件缩松与粉末冶金致密化的关键
国自然答辩PPT模板制作指南:五段式结构让评审看清科研思路
六大开放挑战:Awesome-WAM带你展望World Action Model的下一步方向

今日推荐

Debian新手入门:从部署到日常操作的完整指南
MongoDB复制集扩缩容实战:从rs.add到选主事故复盘
条形码目标检测数据集实战:从YOLOv8训练到部署

本周热门

UE动画修改实战:从资产编辑到重定向与蒙太奇驱动
统计随机数生成器攻击下的KLJN安全密钥交换协议Matlab仿真
政务API安全治理:资产测绘、低代码编排与行标对标实践

本月精选

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)

SenseNova sn-infographic 提示词质量评估标准详解:R01–R08 必答项与 O01–O12 选答项实战指南

发布时间:2026/10/12 6:49:09
SenseNova sn-infographic 提示词质量评估标准详解:R01–R08 必答项与 O01–O12 选答项实战指南 AI 技能人工智能深度研究数据分析媒体生成【免费下载链接】SenseNova-SkillsModular SenseNova skills for building AI-powered office assistants and productivity workflows项目地址https://gitcode.com/gh_mirrors/se/SenseNova-Skills点击查看免费下载sn-infographic是 SenseNova-Skills 仓库中的信息图生成场景技能tier 1其核心流水线包含提示词质量评估 → 内容分析与布局/风格选择 → 提示词扩写 → 多轮生成与 VLM 审查 → 质量排序五个阶段。本文围绕技能核心参考文档 evaluation-standard.md 展开完整讲解该评估标准的角色设定、8 个必答项、12 个选答项的判定语义以及它们如何驱动是否扩写的自动决策should_expand并结合 SKILL.md 中的 Step 1 实现与 sn_agent_runner.py 调用链给出可落地、可复用的提示词质量评估方法论。读完本文你将掌握一套可用于任何图像生成任务信息图、海报、插画、数据可视化的提示词自检清单并能理解 SenseNova 技能如何用结构化 JSON 让 LLM 的评估结果进入确定性分支逻辑。一、评估标准在 sn-infographic 流水线中的定位在sn-infographic的 Worker Agent 工作流中提示词质量评估发生在Step 1是是否重写用户图像提示词的决策入口。根据 SKILL.md 的定义该步骤始终执行Step 1 always runs并通过PROMPTS_EXPAND_MODE参数决定评估与扩写的关系auto默认先执行评估调用仅当提示词质量不达标时才进入 Step 2 扩写force跳过评估无条件进入 Step 2 扩写disable跳过评估与扩写将user_prompt直接作为expanded_prompt用于图像生成。评估调用由 Worker 直接发起一次sn-text-optimize请求不派生子 Agent其 system prompt 就是本评估标准文件EVAL_ENVELOPE$(python $SN_IMAGE_BASE/scripts/sn_agent_runner.py sn-text-optimize \ --system-prompt-path $SKILL_DIR/references/evaluation-standard.md \ --user-prompt $USER_PROMPT \ --output-format json | python $SN_IMAGE_BASE/scripts/extract_json.py)其中$SN_IMAGE_BASE指向 sn-image-base 技能的安装目录sn_agent_runner.py负责统一封装 LLM 调用并输出 JSON envelope{status, result, model, ...}评估结果的内层 JSON 位于.result字段中其 schema 即本文件定义的required_results与optional_results。整个链路说明评估标准不是一份孤立的文档而是被--system-prompt-path直接注入 LLM 的角色指令与输出契约。二、必答项 R01–R08提示词质量的最小可生成门槛评估标准将 8 个必答项Required questions定义为提示词是否具备被图像模型稳定落地为完整信息图的最基本条件。每一项都要求评估者用yes/no明确作答全部为yes才构成required_pass。下面逐项拆解其判定语义与常见误判。R01非空且包含可操作的图像描述信息Is the prompt non-empty and does it contain actionable image description information (rather than only a title or short phrase)?判定的是提示词是否可执行。仅有标题式短语如生成一张公司介绍图或高度概括的一句话无法为图像模型提供画面要素应判no。可操作信息的典型标志是提示词中能提取出可被绘制的实体、数量、位置、色彩等指令性内容。R02明确指定主体对象或主要视觉主体Does the prompt clearly specify a subject object or main visual subject (such as an infographic, chart, illustration, poster, etc.)?要求提示词首先回答画的是什么。信息图infographic、图表chart、插画illustration、海报poster等均可作为主体。缺少主体声明的提示词图像模型无法确定构图焦点。R03包含至少一种结构化信息Does the prompt include at least one type of structured information (for example: sections/regions/modules/steps/order/comparison/list, in any form)?信息图区别于单张插画的关键在于信息的组织方式。分区sections、模块modules、步骤steps、顺序order、对比comparison、列表list等任意形式的章节结构都算命中。这一项直接决定画面是否存在骨架。R04包含至少一种视觉描述Does the prompt include at least one type of visual description (such as style, color scheme, background, composition, visual mood, etc.)?视觉描述覆盖风格style、配色color scheme、背景background、构图composition、视觉情绪visual mood等。没有视觉描述的提示词生成的画面将缺乏风格一致性。仓库在扩写阶段还要求更严格的纹理描述见下文第三节的 prompts-expand-system 约束但本项只需存在任一视觉描述即可判yes。R05包含至少一个具体视觉元素Does the prompt include at least one concrete visual element (such as icons, people, shapes, arrows, borders, etc.)?图标icons、人物people、形状shapes、箭头arrows、边框borders等具体视觉元素是画面血肉。注意它与 R03 的区别R03 关注结构层级R05 关注可绘制的具象元素。R06包含可直接绘制或排版的内容细节Does the prompt include content details that can be directly drawn or typeset (such as text labels, explanatory text, module content, etc.)?信息图必然承载文字内容。文本标签text labels、解释性文字explanatory text、模块内容module content等可被直接绘制/排版的细节是信息密度的基础。这一点与 R05 的视觉元素形成互补R05 偏图形R06 偏文本内容。R07反映元素间的组织关系Does the prompt reflect organizational relationships among elements (such as positional, sequential, connection, or hierarchical relationships)?位置关系positional、时序关系sequential、连接关系connection、层级关系hierarchical任选其一即命中。没有组织关系的提示词只描述了有哪些元素而未描述元素如何摆放无法支撑稳定构图。R07 与 R03 的区别在于R03 的结构化信息是静态的章节存在R07 更强调元素之间的关系动词靠左、位于下方、连接、层级递进等。R08具备足够的长度与细节密度以支持稳定全场景生成Does the prompt provide sufficient length and detail density to support stable full-scene generation by the LLM?这是对整体信息量的总闸门。短提示词即使麻雀虽小五脏俱全各单项均命中若整体细节密度不足以支撑 LLM 铺满整个画布仍判no。结合仓库扩写规范可佐证Step 2 扩写目标约为 400–600 词见 prompts-expand-system.md可以反推本项对充分细节密度的期望量级。必答项小结编号判定焦点一句话自检R01可执行性提示词能否直接驱动绘制R02主体声明是否明确画的是什么R03结构化信息是否有章节/模块/步骤等骨架R04视觉描述是否有风格/配色/构图等描述R05具体视觉元素是否有图标/形状/箭头等具象元素R06内容细节是否有可排版绘制的文本内容R07组织关系是否描述元素间的位置/连接/层级R08长度与密度细节量是否足以铺满全场景三、选答项 O01–O12提示词的锦上添花维度12 个选答项Optional questions不构成硬性门槛但通过命中率参与扩写决策详见第四节。它们可按主题分为四个维度一逻辑与信息处理O01–O03O01 因果关系/逻辑推理提示词是否描述因果或推理链条如由于 A 导致 B。信息图用于解释而非罗列时该项倾向命中。O02 数据编码/可视化方法是否提及数据如何被编码为图形柱状、饼状、折线、气泡等。数据类信息图命中该项目的概率高。O03 信息重要性/优先级区分是否区分不同信息的重要级主标题 vs 次要说明 vs 脚注。它与信息图的层级排版直接相关。二场景与氛围O04、O08、O12O04 背景上下文/场景设定是否描述背景语境如企业年度汇报场景。背景语境可帮助模型推断配色与排版取向。O08 情感氛围是否唤起情绪基调庄重 solemn / 活泼 lively / 神秘 mysterious 等。O12 目标受众/应用场景是否指定受众或投放场景如面向管理层、用于社交媒体。结合 analysis-framework.md 的 Audience Analysis 维度受众画像直接影响复杂度与风格选择。三视觉丰富度O05、O06O05 动态效果/交互元素是否提及箭头、连接线等引导视觉动线的元素。注意 prompts-expand-system.md 对箭头使用持保守态度Minimize the use of arrows尽量用空间邻近与对齐暗示连接但评估层面只要提示词提及此类元素即命中。O06 材质/纹理描述是否提供金属/木质/透明等材质描述。扩写阶段被列为Mandatorily describe background textures说明材质是信息图高级感的重要来源。四语言与文化O07、O09、O10、O11O07 文化含义/象征意义是否承载文化或象征语义如中国传统元素、行业隐喻。O09 领域相关英文术语的恰当使用是否恰当使用领域英文术语如 KPI、roadmap、timeline。信息图常混合中英文专业词汇。O10 中英文文本标签的使用区分是否区分中英文标签的使用位置如中文正文 英文数据标签。O11 总结/结论导向内容描述是否包含结论性表述如结论……、总体来看。信息图的Takeaway区块常命中此项。选答项小结编号维度典型命中场景O01逻辑因果链、推理过程O02逻辑图表编码方式O03逻辑主次信息分级O04场景背景语境设定O05视觉箭头/连接线/动线O06视觉金属/木质/透明材质O07文化文化符号、行业隐喻O08氛围庄重/活泼/神秘情绪O09语言领域英文术语O10语言中英文标签分工O11内容总结性表述O12场景受众与投放场景四、严格 JSON 输出契约与 should_expand 判定逻辑评估标准的最后一部分规定了严格 JSON 输出格式不允许任何额外内容{ required_results: [ {id: R01, answer: yes}, {id: R02, answer: no} ], optional_results: [ {id: O01, answer: yes}, {id: O02, answer: no} ] }这一机器可解析的输出契约是整个流程可自动化的前提。在 SKILL.md 的 Step 1 中内层评估 JSON 位于 envelope 的.result字段判定逻辑如下required_passrequired_results中所有answer均为yesoptional_passoptional_results中answeryes的数量占总数的比例≥ 0.6should_expand not (required_pass and optional_pass)。也就是说任何一项必答项不达标或选答项命中率低于 60%都触发提示词扩写。这两个阈值构成一个清晰的及格线模型必答项是充分必要条件一票否决选答项是加权软指标60% 的宽松门槛。保守回退与容错评估调用本身可能失败envelope 的status ! ok或extract_json.py无法从.result中恢复 JSON。此时流程不中止而是采用保守策略默认should_expand true即拿不准就扩写。这与 Step 2.0 / 2.3 中评估失败即返回 Error Flow 的处理形成对比——Step 1 的失败成本远低于图像生成失败因此选择了更宽容的降级路径。解析层面对 JSON 契约的依赖由于 LLM 输出可能携带多余散文或json代码围栏仓库要求在解析前统一经过 extract_json.py读取 stdin输出恢复后的 JSON找不到 JSON 时以非零退出码返回。对 envelope 与内层评估 JSON 都要做这一处理extract_json.py非零退出即视为响应不可用。这解释了为什么评估标准要求strict JSON, no additional content——解析管线的健壮性建立在输出格式的纪律性之上。五、评估与扩写、审查的协同关系提示词质量评估并非孤立环节它与流水线其他参考文档形成完整闭环1. 评估 → 扩写prompts-expand-system.md当should_expand true时Worker 进入 Step 2先经 analysis-framework.md 做内容分析产出data_type/tone/audience再随机挑选布局与风格见references/layouts/与references/styles/下的定义文件备选 87 种布局与 66 种风格最后用 prompts-expand-system.md 作为 system prompt 将结构化内容扩写为约 400–600 词的完整图像提示词。扩写约束文本必须加引号、图标必须具象描述、禁止十六进制色码、保留全部数据等正好补足了评估标准 R05/R06/R07 对可绘制细节的期待。2. 评估 → 审查prompts-critic-system.mdStep 1 的评估针对提示词文本而 prompts-critic-system.md 定义的 VLM 审查针对生成后的图像9 条 Veto Rules 覆盖结构完整性、布局均衡、文字可读性、连接线设计、色彩保真等。两者一前一后构成输入质量把关 输出质量把关的双保险评估防止烂提示词进流水线审查防止烂图像出流水线。3. 多轮迭代与排序当max_rounds 1时VLM 审查结果PASS/FAIL、violations 列表驱动 Step 3 的早停与 Step 4 的排序按violations_count升序 round升序最终输出质量排名。评估标准决定了扩写与否扩写质量又间接影响后续每一轮的生成与审查成本因此它是整个质量闭环的第一道闸门。六、评估标准的实战应用要点6.1 复用方式以 system prompt 形式注入本评估标准在仓库中始终以--system-prompt-path方式整体注入 LLM而不是人工逐项打分。实践中的最佳用法同样如此把它作为角色指令 输出契约让 LLM 以严格 JSON 返回随后用程序化逻辑all-yes 60% 阈值做最终裁决。评估是模型的产出判定是代码的产出二者职责分离避免主观偏差进入决策。6.2 与扩写模式的配合auto 模式下质量达标的优质提示词如已包含详细布局、风格、文本内容的专业提示词会跳过扩写保留用户原始意图对内容零散、仅一句需求做一张信息图介绍产品的输入评估几乎必然触发扩写这正是该标准存在的意义force 模式适合始终需要标准化提示词结构的场景disable 模式适合用户已给出完整可执行提示词、追求零改写保真的场景。6.3 判定时的常见陷阱R02 与 R03 混淆R02 只问主体类型R03 问章节结构一张海报若无分区描述R02yes 但 R03no。R05 与 R06 混淆R05 是图形元素图标/形状/箭头R06 是文本内容标签/说明文字只有图形元素的提示词 R06 可能仍为 no。R07 与 R03 混淆R03 是结构的静态存在R07 是元素间的关系描述包含三个模块命中 R03而模块 A 位于顶部、箭头连接至模块 B才命中 R07。选答项 0.6 阈值的边界12 项选答项中至少 8 项命中12 × 0.6 7.2向上取整为 8才通过optional_pass接近及格线时应复核每项判定是否过于宽松。6.4 面向其他图像生成任务的迁移本评估标准的 20 项指标不绑定信息图场景。迁移到海报、插画、数据可视化、UI 概念图等任务时只需调整 R02 的主体类型枚举与 O02 的图表类型枚举其余项可执行性、视觉描述、具体元素、组织关系、细节密度、材质、文化、情绪、受众对任何文生图提示词都成立可直接作为通用提示词质量自检清单。七、总结evaluation-standard.md以角色设定 20 项二元问题 严格 JSON 契约的形态为sn-infographic的提示词质量把关提供了可编程的质量模型8 个必答项守住可生成底线12 个选答项衡量生成得好不好的潜力all-yes 与 60% 命中率的组合决策把 LLM 的模糊评估转化为确定的should_expand布尔值。配合 SKILL.md 的 Step 1 调用链、extract_json.py 的容错解析、prompts-critic-system.md 的 VLM 图像审查这套输入评估 → 条件扩写 → 生成 → 审查 → 排序的流水线展示了如何用一份结构化评估标准将提示词质量这一主观概念工程化、可度量、可自动化。赞分享AI 技能人工智能深度研究数据分析媒体生成【免费下载链接】SenseNova-SkillsModular SenseNova skills for building AI-powered office assistants and productivity workflows项目地址https://gitcode.com/gh_mirrors/se/SenseNova-Skills点击查看免费下载相关推荐评估Basdonax AI RAG问答质量评测指标与方法评估Basdonax AI RAG问答质量评测指标与方法 你是否在使用Basdonax AI RAG时遇到回答不准确、相关性低的问题本文将从核心指标、评测流如何快速实现LLM问答质量评估BLEU与ROUGE指标计算指南如何快速实现LLM问答质量评估BLEU与ROUGE指标计算指南 在大模型应用开发中评估问答质量是确保系统可靠性的关键步骤。Datawhale / llm u教程大模型RAGAI 应用如何安装Cemu Graphic Packs新手必备的3分钟快速上手教程如何安装Cemu Graphic Packs新手必备的3分钟快速上手教程 Cemu Graphic Packs是提升Cemu模拟器游戏体验的必备工具通过安装上一篇GB28181 视频平台 5 分钟部署指南下一篇ZonyLrcToolsX 批量下载歌词完整指南一条命令为本地音乐库补齐 LRC 歌词创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号