恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
Agent-Native模型赛道开卷:基元律动之外还有谁在押注
首页
资讯中心
/
Agent-Native模型赛道开卷:基元律动之外还有谁在押注
Agent-Native模型赛道开卷:基元律动之外还有谁在押注
发布时间:2026/10/10 12:05:44
Agent-Native模型赛道开卷基元律动之外还有谁在押注【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B2026 年 9 月基元律动TokenRhythm联合无问芯穹、清华大学、北京大学、阿里巴巴发布技术报告推出首个 Agent-Native 模型 NeoHorse-1含 4B 与 9B 两个版本把让 Agent 用工具、收反馈、纠错误这件事从前端框架推进到了模型训练层。同一时间围绕4B 小模型干翻 9B 通用模型的社区讨论持续升温CSDN 上与之相关的部署、微调、评测教程在两周内密集涌现。一个信号已经足够清晰大模型竞赛的下半场押注点正从参数规模转向Agent 原生能力。本文结合 NeoHorse-1-4B 开源仓库的源码级细节拆解这条赛道的定义、玩家、技术路线与商业化逻辑。什么是 Agent-Native从会聊天到会干活Agent-Native 与通用大模型的本质差异社区里已有相当一致的经验性总结通用模型优化的是对话质量Agent 模型优化的则是输出约束性、确定性推理与格式稳定性。基元律动在技术报告中的定义更直白——将 Agent 使用工具、接收反馈和修正错误的经验转化为模型自身的参数能力。换句话说通用模型把工具调用当作事后拼接的提示工程Agent-Native 模型则把工具调用当作训练信号本身。这一差异在仓库的 chat_template.jinja 中体现得十分具体。该模板内建了一套结构化的函数调用协议系统提示注入toolsJSON 工具清单模型以tool_call包裹function...与parameter...的 XML 形式发起调用工具结果以tool_response回传多轮工具调用之间允许模型输出自然语言推理。配合think推理标签模型被训练成先想清楚、再决定调哪个工具、最后按格式落盘的执行单元而非自由发挥的聊天对象。部署侧同样印证了这一取向README 给出的 SGLang/vLLM 启动参数中--reasoning-parser qwen3与--tool-call-parser qwen3_coder是标配也就是说推理框架层面就默认了工具调用与思维链的解析器绑定。玩家图谱谁在押注这条路线押注 Agent-Native 的玩家大致可分为三类而基元律动恰好卡在三者的交汇处。第一类是模型即 Agent的先行者。NeoHorse-1-4B 的官方评测表中同场竞技的是 Qwen3.5-4B、Gemma-4-E4B-it、Nanbeige-4.2-3B、Agents-A1-4B、Spark-X2.5-4B 五款开源模型其中至少三款是 4B 量级、明确面向 Agent 场景的竞品——这本身就是一张赛道玩家的快照头部厂商与创业公司都在 4B 这个性价比甜点上布局。第二类是框架转模型的路线派。基元律动的特殊之处在于其创始人王云鹤此前执掌过华为诺亚方舟实验室与盘古大模型而公司在发布模型之前先开源了 Routing Harness 系统 OpenSquilla——一个在 Agent 执行任务时负责选谁干活、怎么调度的模型路由框架。NeoHorse 的意义在于把这条前端工具链延伸到了后训练阶段路由系统产出的执行轨迹反过来成为模型的学习语料。工具链、执行数据和模型训练第一次形成了自洽的闭环。第三类是决策专用的细分生态。社区情报显示围绕 NeoHorse 已生长出一批聚焦决策模型的衍生实践——对标 Jev 的 NeoHorse-Jev-4B 系列主打多候选方案评分、工单分流、风控判断等结构化决策任务采用 SFT GRPO/DPO 两阶段训练与 JSON 强约束输出。这条支线说明Agent-Native 赛道内部正在快速分化一端是通用工具执行型一端是专用决策评分型而两者的评估语言格式合规率、任务完成率而非对话榜单已经和传统 LLM 评估分道扬镳。技术路线三种并行的押注方式从仓库源码与官方文档出发可以看到三条清晰的技术路线其一Routing Harness 驱动的递归自我提升RSI。这是 NeoHorse 最独特的押注。README 完整描述了这条闭环routing harness 将任务分配给异构模型池记录工具交互与结果估计能力需求并以能力级反馈塑造下一轮训练数据混合更新后的模型重新回到 harness 中服役从而闭合一个评估—选择—更新的原型循环。配套的后训练框架是路由引导的课程式 SFTrouting-guided curriculum SFT与路由引导的在线蒸馏routing-guided on-policy distillation把执行轨迹转化为训练信号同时保留每条响应前后的执行与 harness 上下文。这不再是造一个更强的模型而是造一个会自己变强的系统——头条社区把它比喻为一匹会自己找教练的马颇为传神。其二数据管线层面的工程化。训练语料以 OpenSquilla 等 Routing Harness 产生的执行轨迹为核心保留能力需求预测、路由选择、模型响应、工具调用与环境反馈五个环节并经过完整性检查及目标完成、证据一致性、错误恢复等质量评估。仓库 README 列出的数据治理手段包括精确与近似去重、评测数据去污、结构化校验、六维语义评估、以及场景级 Scene/Goal/Outcome 标注。Agent 训练数据的难点不在于多而在于轨迹是否完整、失败是否被记录——这套流水线给出了可复制的答案。其三混合注意力架构与超长上下文。打开 config.json 可以看到 NeoHorse-1-4B 的骨架32 层中 28 层为 linear_attention线性注意力每 4 层插入一层 full_attention全注意力hidden_size 2560、intermediate_size 9216、head_dim 256。权重索引 model.safetensors.index.json 进一步证实216 个 linear_attn 张量对 48 个 self_attn 张量线性注意力占绝对主体——这是把 262,144 token 原生上下文可扩展至 1,010,000压进 4B 参数的硬件前提也是4B 在低显存上逼近更大模型传闻的架构来源。权重量级为 Safetensors/BF16总计约 8.4GB两张分片即可装载。工程落地4B 尺寸的部署自由与协议约束Agent 模型的价值必须落地到可被 Agent 框架调用。NeoHorse-1-4B 在这点上给出了教科书式的低门槛方案。README 提供两套启动路径SGLang v0.5.17 的python3 -m sglang.launch_server --served-model-name neohorse-1-4b与 vLLM 的vllm serve两者均暴露 OpenAI 兼容的/v1/chat/completions端点并以--max-model-len 262144对齐上下文上限。结合社区实践从 llama.cpp 的 GGUF 量化、Ollama 一键装载到 vLLM 的 PagedAttention 与连续批处理再到 guided decoding 强制 JSON 输出4B 量级意味着消费级显卡与单卡 16GB 内网服务器都能完整走通部署—推理—结构化输出链路也因此成为 Codex 等 Agent 工具链中低延迟决策节点的热门候选。需要留意的是协议约束的另一面模型虽然以 Apache-2.0 开源但上游底座是 Qwen3.5-4B其版权归属 Alibaba Cloud许可证文件与模型卡中均保留了上游版权声明与 TokenRhythm 的修改声明LICENSE 与 tokenizer_config.json 中的modification_notice字段可查。也就是说商用自由度建立在尊重上游版权、保留声明的前提之上——这为后来者提供了清晰的合规路径也提示了 Agent-Native 赛道基座依赖的现实多数押注者仍是在他人的地基上盖房子。评测Agent 能力的度量正在成型Agent 模型的评测体系正在从对话榜单转向任务完成。NeoHorse-1-4B 的官方结果提供了可参照的度量方式在 QwenClawBench 44.68、WorkBuddy Bench 34.41、PinchBench 77.33、tau2-Bench 88.46 四个 Agentic 基准上均位列参评模型第一对比模型含 Qwen3.5-4B、Gemma-4-E4B-it、Nanbeige-4.2-3B、Agents-A1-4B、Spark-X2.5-4B十个基准的 macro 平均 64.87较基座 Qwen3.5-4B 的 58.94 提升 5.93。评测协议同样值得记录SGLang v0.5.17、temperature1.0、top_p0.95、top_k20、presence_penalty1.5且开启 thinking 模式并强制非空推理内容——Agent 基准的分数对采样参数极其敏感脱离协议谈分数没有意义。但数据也呈现了必要的诚实VitaBench 上 NeoHorse-1-4B 的 32.00 落后于 Agents-A1-4B 的 39.25LiveCodeBench v6 的 59.43 亦低于 Nanbeige-4.2-3B 的 72.50。这说明 Agent-Native 后训练带来的是能力再分配而非全面碾压——在需要多模态仿真与在线代码执行的部分场景4B 量级仍有明显天花板。这恰恰是赛道健康度的证据没有一家能在所有维度通吃差异化空间依然充足。未来 12 个月三个观察点基于现有情报与仓库状态未来一年这条赛道的胜负手大概率集中在三处一是 RSI 闭环能否跑完第二圈。NeoHorse-1 目前只是原型闭环harness 记录轨迹、反馈塑造数据、更新模型回炉。真正的递归自我提升要求这个循环在多轮迭代中持续产生可测量的能力增益而非一次性提升后收敛。谁先把第二圈的收益公开化谁就定义了 Agent-Native 的上限叙事。二是评估基准的标准化。QwenClawBench、WorkBuddy Bench、tau2-Bench 等基准的出现说明任务完成率 格式合规率 错误恢复率正在取代困惑度与对话打分。接下来 12 个月这些基准能否形成跨厂商公认的协议包括采样参数、模拟器、裁判模型将直接决定各家宣传口径的可比性。三是决策专用与通用执行的生态分化。社区对 NeoHorse-Jev-4B 一类决策模型的热衷LoRA 微调、GBNF/JSON Schema 约束、temperature0.1 的工程信条表明企业级 Agent 落地更稀缺的是稳定输出可审计结论的决策引擎而非博学多才的通才。基元律动手握 RSI 方法论与 OpenSquilla 调度层能否将通用执行模型与专用决策模型统一进同一套数据反馈体系是比单点模型发布更值得关注的战略问题。Agent-Native 赛道的开卷信号已经足够响亮当路由—执行—反馈—再训练成为模型的自我进化回路当 4B 参数成为可私有化、可微调、可审计的默认尺寸模型竞争就不再只是算力与参数的军备竞赛而是一场关于系统如何从执行中学习的工程竞赛。基元律动押注的是整条闭环而闭环一旦成立模仿者将面临的不只是追赶一个模型而是追赶一套会自我更新的方法论。【免费下载链接】NeoHorse-1-4B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-4B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考