恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

Iteration N (YYYY-MM-DD HH:MM, 耗时 Xs)

  • 首页
  • 资讯中心
  • /
  • Iteration N (YYYY-MM-DD HH:MM, 耗时 Xs)

相关资讯

黑烟车识别系统实战:YOLOv8n+轻量分类头部署方案 2026/9/14 2:37:58
微信回应视频号异常:如果这是你的秋招面试题,你怎么答? 2026/9/14 2:37:58
字节DeerFlow 2.0开源:智能体开始“自己干活”了,测试开发能蹭到什么? 2026/9/14 2:37:58

最新资讯

CTM交叉口仿真与MATLAB实现:从流量守恒到排队分析
谷歌浏览器装其他盘:压缩包解压与用户数据重定向实操指南
网上影院系统App开发实战:从源码复现到Android全栈闭环
轻量开源版 IDEA:JVM 开发者的精准减负实践
JSP+Servlet+JDBC实战:手把手开发蛋糕店购物商城系统
Django网络健身俱乐部项目:数据库模型与预约业务实战解析

今日推荐

ASP+Access库存管理系统源码部署与IIS配置实战指南
基于SSM框架的毕业季旧物分类处理系统设计与实现
MATLAB FFT频谱仿真:从DFT原理到参数设置与窗函数选择

本周热门

AI SDK Harness 依赖更新指南:掌握 harness 包 SDK 依赖的升级、桥接同步与一致性校验
Refine v5 Ant Design NumberField 组件实战:基于 Intl 的本地化数字格式化
Flutter应用改名全指南:从Android到iOS的配置与工具实践

本月精选

自研推理加速器Redwood:两周内实现PyTorch模型高效部署的实战教程
V4L2摄像头采集实战:从camera_client.rar到出图全流程解析
从“谁发明了钢琴键”到知识问答智能体:RAG与记忆工程实践

Iteration N (YYYY-MM-DD HH:MM, 耗时 Xs)

发布时间:2026/9/14 2:42:59
Iteration N (YYYY-MM-DD HH:MM, 耗时 Xs) Iteration N (YYYY-MM-DD HH:MM, 耗时 Xs)【免费下载链接】RD-AgentResearch and development (RD) is crucial for the enhancement of industrial productivity, especially in the AI era, where the core aspects of RD are mainly focused on data and models. We are committed to automating these high-value generic RD processes through RD-Agent, which lets AI drive>项目地址: https://gitcode.com/GitHub_Trending/rd/RD-Agent状态: ✅ 成功 / ❌ 失败 (exit_codeX)Score: X | Improvement: X | Best: X (iter N)训练类型: GRPO / SFT / PPO / copy_model / placeholder / unknown关键配置: lrX, epochsX, batchX, ...从代码中提取做了什么: 具体策略训练方法、reward 函数设计、数据处理等为什么: 为什么选择这个策略基于上轮结果的推理问题/进步: 发现了什么问题或相比上轮取得了什么进步关键代码: 最能体现本轮策略的 3-5 行代码代码片段上下文: 从 train.py 复制 15-40 行可运行上下文标注函数名/行号范围若与上轮相同写与 Iteration N 相同无变更各字段的设计意图与取值说明如下 | 字段 | 取值约束 | 说明 | |------|----------|------| | 标题 | Iteration N (YYYY-MM-DD HH:MM, 耗时 Xs) | N 为递增迭代号时间精确到分钟耗时单位秒 | | 状态 | ✅ 成功 / ❌ 失败 (exit_codeX) | 直接关联本次运行进程的退出码 | | Score 行 | Score / Improvement / Best (iter N) | 三分量缺一不可Best 需标注出自第几轮 | | 训练类型 | GRPO / SFT / PPO / copy_model / placeholder / unknown | 枚举值从 code/train.py 源码中判断无法确定写 unknown**不留空** | | 关键配置 | lrX, epochsX, batchX, ... | 从训练脚本中提取的真实超参数 | | 做了什么 | 自由文本 | 训练方法、reward 函数设计、数据处理等 | | 为什么 | 自由文本 | **必须引用上轮证据**scores.json / run.log / agent.log | | 问题/进步 | 自由文本 指标 | 必须包含过程指标或失败类型见第五节 | | 关键代码 | 3-5 行 | 最能体现本轮策略的代码 | | 代码片段上下文 | 15-40 行 | 可运行上下文标注函数名/行号范围无变更则写明与 Iteration N 相同无变更 | ### 3.1 关键配置的提取示例 以仓库自带的 [example_agent/train.py](https://link.gitcode.com/i/1952e6a739381c4ddb4977a34d24ed42) 为例其 GRPO 训练循环中的配置可直接映射为 summary 字段 python config GRPOConfig( output_dirOUTPUT_DIR, max_steps20, # → key_config: max_steps20 per_device_train_batch_size2, # → batch2 gradient_accumulation_steps4, # → grad_accum4 learning_rate1e-5, # → lr1e-5 max_completion_length256, # → max_completion_length256 num_generations4, # → num_generations4 bf16True, )对应 summary.md 中可写为**关键配置**: lr1e-5, batch2, grad_accum4, max_steps20, max_completion_length256, num_generations4。这些字段都能在code/train.py中被直接检索从而保证关键配置必须从代码中提取这一规则可执行、可复核。四、数据来源建议与底层文件生成机制skill.md按优先级给出了每个字段的数据来源字段数据来源Score / Improvement / Bestscores.json或服务器返回状态 / 耗时 / exit_coderun.log训练类型 / 关键配置 / 关键代码code/train.py失败根因agent.logrun.log4.1 scores.json 如何产生scores.json由 Grading Server 维护实现见 server.py。每次/submit请求触发评测后服务器会把一条完整记录写入workspace/scores.jsonentry { submission_id: submission_id, timestamp: datetime.now().isoformat(), model_path: model_path, score: score, baseline_score: self.baseline_score, improvement: improvement, elapsed_seconds: round(elapsed_seconds, 2), }其中improvement score - baseline_scorebaseline 通过/set_baseline注入而best由服务器从全部提交中取max(score)计算server.py。也就是说summary 中的Score / Improvement / Best与 scores.json 中的score / improvement / best.score一一对应Agent 可以直接把/submit的 JSON 响应原样纳入 summary确保数值与评测系统一致。4.2 run.log 与 agent.log 的分工run.log由 run.py 通过 loguru 按run_id写入 workspace记录整个 run 的生命周期事件资源准备、baseline 评测、Agent 启动/超时/退出码等。agent.logAgent 子进程的 stdout/stderr 合并输出subprocess.Popen以start_new_sessionTrue启动见 run.py训练报错、堆栈、curl 提交失败等信息都在这里。因此判断成功 / 失败 (exit_codeX)应读取 run.log 中的进程退出码定位失败根因则需交叉查看 agent.log 中的错误输出与 run.log 中的时间线。4.3 run_meta.json时间与预算的唯一事实源Agent 在 workspace 中还会看到run_meta.json由 init_run_meta 初始化包含start_time、timeout_s、last_submit_time、end_time。每次提交后服务器会通过update_run_meta(workspace, last_submit_time...)刷新该文件。summary 标题中的耗时 Xs即可用end_time - start_time或当前时间与 start_time 之差推算这也是唯一被信任的时间来源GET /time接口仅作补充。五、10 条写入规则深入解读skill.md的规则部分是本规范的核心逐条展开如下。规则 1追加不覆盖reports/summary.md是累积式日志每一轮 section 只能追加在文件末尾。已有历史记录是后续轮次为什么推理的证据基础覆盖等于销毁决策链。规则 2Iteration 严格递增写入前必须先读取reports/summary.md中最后一个迭代号当前写入的必须是N1若不满足先修正如补充缺失轮次再写入。这保证了实验记录是连续的、无空洞的也便于后续轮次按编号索引证据。规则 3训练类型与超参数必须从源码提取分析code/下的源码提取训练类型和超参数无法确定时写unknown不允许留空。从仓库看训练脚本自由度很高code/完全由 Agent 自组织见 instructions.md因此从代码提取是唯一可靠的判断方式——例如trl的GRPOTrainer对应 GRPOSFTTrainer对应 SFT。规则 4失败必须给出可定位根因与 failure_type训练失败时必须给出可定位的根因日志片段或错误类型并标注failure_type。规范预定义的枚举为failure_type典型场景code_error_runtime训练脚本运行时异常ImportError、OOM、数值错误等rollout_logic_wrong训练 roll-out/采样逻辑错误导致训练无效timeout_no_submission预算耗尽仍未提交有效模型copy_model_fallback未训练直接提交基线模型只能得到 baseline 分improvement0training_diverged训练发散loss 爆炸、reward 异常等unknown无法归类与这些类型对应的评测侧保护机制可以在源码中找到印证例如 opencompass.py 会拒绝提交目录中存在adapter_config.json的 LoRA adapter要求先merge_and_unload合并为完整模型instructions.md 明确禁止直接提交拷贝或软链接的基座模型因为未训练模型只会拿到 baseline 分improvement0浪费一次提交——这正是copy_model_fallback的语义来源。相关行为在 test_fixes.py 中有自动化测试覆盖。规则 5做了什么 / 为什么必须可复现、可检验为什么必须引用上一轮证据scores.json / run.log / agent.log。例如为什么: 上一轮Iteration 3scores.json 显示 improvement20.0 但 Best 仍停留在 iter 268.0且 run.log 显示本轮在最后 10 分钟才提交推测是时间分配不均导致本轮改为先小步快跑验证 reward 函数再延长单轮训练。这种写法让后续轮次或人类审查者可以沿着证据链复现决策过程而非凭空猜测。规则 6问题/进步必须包含过程指标或失败类型不能只写效果变好了必须给出可量化的过程指标规范中明确列举valid_submission_rate有效提交score0占总提交数的比例first_valid_idx第一次出现有效分数的提交序号time_to_first_improvement距 start_time 首次超过 baseline 的秒数time_used_ratio实际耗时 / 总预算end_time - start_time 与 timeout_s 之比failure_type本轮失败的类型这些指标并非随意定义而是与 metrics.py 中compute_metrics计算并写入reports/metrics.json的指标完全对应。例如valid_scores [s for s in score_values if s and s 0] valid_submission_rate _safe_div(len(valid_scores), len(score_values)) for idx, score in enumerate(score_values, start1): if score and score 0: first_valid_idx idx break if baseline is not None and start_time: for entry in scores: if entry.get(score, 0.0) baseline: time_to_first_improvement int(ts.timestamp() - start_time) break即 summary 中手工填写的过程指标与框架自动计算的 metrics.json 形成双轨对照Agent 手写值可以被机器计算值校验防止编造。规则 7长代码片段每轮最多 1 段、最多 40 行优先贴本轮新增或改动的代码若与上轮相同写与 Iteration N 相同无变更。这既保证总结可复现又避免 summary 无限膨胀。注意与关键代码3-5 行的区别前者是摘要性精炼后者是带函数名/行号范围的可运行上下文。规则 8重复根因避免整段重复若与上一轮根因相同明确写出新增证据 / 新增尝试 / 无新增。例如问题/进步: 与 Iteration 5 相同的 timeout_no_submission新增证据run.log 显示 GRPO 训练在 step 180 因 vLLM 与训练器 colocate 导致 OOM新增尝试将num_generations从 8 降到 4。无新增失败。规则 9同步追加 summary.jsonl可量化字段reports/summary.jsonl与 summary.md 同目录每轮一行 JSON。关键约束仅保留可量化字段供图表使用不写 why/what/next_step 等长文本metrics由 benchmark 后处理统一计算不在 jsonl 中填写。规范给出的示例{iteration: 3, timestamp: 2026-03-10 12:34, duration_s: 812, status: success, exit_code: 0, score: 65.0, improvement: 20.0, train_type: GRPO, failure_type: unknown}字段建议集字段类型说明iterationint迭代号timestampstr时间戳YYYY-MM-DD HH:MMduration_sint本轮耗时秒statusstrsuccess / failureexit_codeint进程退出码scorefloat本轮得分improvementfloat相对 baseline 的提升train_typestrGRPO / SFT / PPO / copy_model / placeholder / unknownfailure_typestr规则 4 的枚举值该文件与 summary.md 的分工对应了人类/LLM 叙事记录与机器统计输入的经典双写模式summary.md 服务策略推理summary.jsonl 服务指标聚合与图表AutoRL-Bench 的 Streamlit 面板 ui.py 即读取全局 results.csv 渲染 Agent 对比与运行历史。规则 10写入后自检 section 完整性写入完成后必须自检上述字段必须齐全缺失则补全后再结束。可对照第三节的字段表逐项核对特别是关键配置不能为空、为什么必须带证据引用、问题/进步必须含过程指标或 failure_type。六、从规范到实践一次完整的 summary 写入示例结合仓库中的 example_agent/train.pyGRPO 训练 每 epoch 提交评测与 Grading Server 的返回结构一轮实验结束后应追加的 section 可写成## Iteration 2 (2026-03-10 12:34, 耗时 812s) - **状态**: ✅ 成功 (exit_code0) - **Score**: 65.0 | Improvement: 20.0 | Best: 68.0 (iter 3) - **训练类型**: GRPO - **关键配置**: lr1e-5, batch2, grad_accum4, max_steps20, max_completion_length256, num_generations4 - **做了什么**: 复用 gsm8k_reward_func正则抽取 #### 后答案并与金标准比较abs diff 1e-6 得 1.0 否则 -1.0按 epoch 训练并在每个 checkpoint 后提交首个 epoch 用原始模型、后续 epoch 用上一个 checkpoint 续训 - **为什么**: Iteration 1 的 improvement0 且 scores.json 显示所有提交 scorebaseline说明模型未被有效训练同时 example_agent 注释提示小 batch 避免 OOM故本轮维持 per_device_train_batch_size2 并将 num_generations4先验证 reward 信号是否生效 - **问题/进步**: valid_submission_rate1.03/3first_valid_idx1time_to_first_improvement512s相比上轮首次突破 baselineimprovement20.0 - **关键代码**: rewards 1.0 if abs(pred - gold) 1e-6 else -1.0 - **代码片段上下文**: load_data() 与 gsm8k_reward_func()train.py L34-L56与 Iteration 1 相同无变更同时同步追加一行 summary.jsonl{iteration: 2, timestamp: 2026-03-10 12:34, duration_s: 812, status: success, exit_code: 0, score: 65.0, improvement: 20.0, train_type: GRPO, failure_type: unknown}七、与 AutoRL-Bench 运行框架的联动7.1 RD-Agent Agent 的多轮循环若使用仓库内置的 rdagent Agentagents/rdagent/config.yaml 与 agents/rdagent/start.sh其通过rdagent.app.rl.loop以--step-n $STEP_N --loop-n $LOOP_N运行内部多轮循环每轮迭代结束即是skill.md要求追加 summary 的时点——这解释了为何规范强调每轮实验结束后而不是全部结束后才记录中间轮次的总结是下一轮策略推理的输入。7.2 评测侧的约束呼应规范中的若干禁止项在评测侧有硬性校验理解它们有助于正确填写 summary禁止提交 LoRA adapter评测器检测到adapter_config.json即返回错误opencompass.py失败类型对应code_error_runtime禁止提交未训练/软链接的基座模型只会得到 baseline 分对应copy_model_fallbacktrl 保存的 tokenizer_config.json 需移除extra_special_tokens字段vLLM/transformers 加载兼容否则评测失败——这是 instructions.md 明确提示的坑点应在问题/进步或失败根因中记录同路径重复提交会被去重缓存命中cache key 路径 模型文件最新 mtime见 server.py因此多版本提交应使用不同目录如output/v1/、output/v2/summary 中标注具体 model_path 才有区分度。7.3 验证与自检的自动化工具仓库提供了两个可直接运行的验证入口可用来校验 summary 中字段与评测系统的对应关系# 运行评测侧修复与防护机制的回归测试含 LoRA 拒绝、baseline 完整性、评测锁、去重缓存、error 透传 python -m rdagent.scenarios.rl.autorl_bench.test.test_fixes # 本地对指定模型执行一次完整评测提交到本地 Grading Server输出完整 JSON 结果 python -m rdagent.scenarios.rl.autorl_bench.test.test_benchmark \ --model-path /path/to/model --task gsm8k --port 15000【免费下载链接】RD-AgentResearch and development (RD) is crucial for the enhancement of industrial productivity, especially in the AI era, where the core aspects of RD are mainly focused on data and models. We are committed to automating these high-value generic RD processes through RD-Agent, which lets AI drive>项目地址: https://gitcode.com/GitHub_Trending/rd/RD-Agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号