恒美微站 Logo 恒美微站
  • 首页
  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心
  • 联系我们

手机、手表、机器人同跑一个 14MB 模型:Needle 把 AI Agent 端侧化带到了哪一步?

  • 首页
  • 资讯中心
  • /
  • 手机、手表、机器人同跑一个 14MB 模型:Needle 把 AI Agent 端侧化带到了哪一步?

相关资讯

Spring Boot应用上下文初始化器:启动早期钩子实战 2026/10/10 20:46:23
Java3实战:基于Java 3D构建可交互三维场景完整指南 2026/10/10 20:46:23
GEO实战:为什么AI搜索不引用你的网站?代码级优化指南 2026/10/10 20:41:23

最新资讯

DHUOJ基础题25-27解析:素数判断、整数倒序与回文串的边界处理
自注册、AST发现与中央分发派系:弹性工具运行时架构解析
基于YOLOv8的道路病害检测平台:从模型训练到前后端部署全流程
电力遥感杆塔检测数据集:400张图跑通YOLO全流程
AI 推理 KV Cache 淘汰:别让长会话吃掉所有显存——TaoToken 统一 Key 下的显存压测与淘汰策略验证
9.5k stars 与日榜 18:YuE2 系列的技术底座和社区入口设计拆解

今日推荐

Codex 总用英文回答?从 AGENTS.md 到 config.toml 的中文输出调优指南
OpenClaw 自定义插件开发完整指南(2026最新版):从 TypeScript 到 npm 发布
基于Spark的电影推荐系统全链路实战:从爬虫到Web展示

本周热门

MR25H40CDF + PIC18F65K40:工业记录仪高可靠存储实战
基于STM32的数控恒压恒流电源设计:从硬件到PID调参全解析
LT9211 MIPI重定时器原理与双路扇出实战指南

本月精选

我发现了一个新思路:用 Remotion + Claude Code 像写代码一样自动化生成短视频
Windows下 Codex 中 Chrome 和 Computer Use 插件不可用问题排查及解决参考方式:TaoToken 统一 Key 配置与验证
2026 大模型集体涨价:用 Python 做企业 Token 成本测算与选型避坑(附配置)

手机、手表、机器人同跑一个 14MB 模型:Needle 把 AI Agent 端侧化带到了哪一步?

发布时间:2026/10/10 20:46:23
手机、手表、机器人同跑一个 14MB 模型:Needle 把 AI Agent 端侧化带到了哪一步? 手机、手表、机器人同跑一个 14MB 模型Needle 把 AI Agent 端侧化带到了哪一步【免费下载链接】needleAutomation foundation model for tiny devices: 2-bit, 8-29 MB, tool calls, ASR, structured extraction and embeddings on phones, wearables, smart homes, robots, cars and microcontrollers.项目地址: https://gitcode.com/GitHub_Trending/needle20/needle当一个 45M 参数的模型被压进 14MB 的单文件二进制再配上一套免反序列化、直接 mmap 的 C 推理引擎AI Agent 就第一次有了手表级的落点。这正是开源项目 Needle 过去几周连续冲上 GitHub 趋势榜的原因它没有去卷参数规模而是把工具调用这一 Agent 最核心的动作压缩到了手机、穿戴设备、智能家居、机器人和微控制器都能本地运行的程度。仓库自述给出的范围是单个 8–29 MB 的二进制覆盖手机、可穿戴、机器人、智能家居、车载与 MCU本文结合仓库源码与社区热度拆解它的硬件版图、内存预算下的能力边界以及从演示到量产还差什么。一个模型多种设备端侧 Agent 的硬件版图Needle 的部署思路不是一个模型适配所有设备而是一个权重文件每种平台一份预编译引擎。在 needle/agent/fetch.py 里PLATFORMS枚举了 17 个部署目标macos-arm64、linux-x86_64、linux-arm64、linux-armv7、linux-riscv64、linux-mipsel、windows-x86_64、windows-arm64、android-arm64、android-armv7、android-riscv64、ios-arm64、ios-sim-arm64、tvos-arm64、watchos-arm64外加wasm与wasm-component两个浏览器目标。这份清单本身就回答了标题的问题手机android/ios、手表watchos、机器人linux-arm64/armv7/riscv64 常见于树莓派类控制器、车载linux-arm64 气隙部署都在射程内。支撑这张版图的是.cact容器的设计。在 needle/model/export.py 的格式说明里权重、分词器与量化码本被封装进一个自包含二进制固定 120 字节头部携带全部架构几何信息随后是无名单张量目录——张量按固定规范顺序排列运行时按位置索引不需要任何名字解析每个张量带 64 字节对齐偏移引擎可直接 mmap 后按偏移读取全程零反序列化。这意味着同一个二进制能加载任意深度的模型变体也意味着跨平台分发的核心是那几行下载逻辑needle build --platform folder会从 Hub 拉取对应平台的引擎 wheel 并把权重放在旁边Linux 下还区分 glibc 与 musl 两套构建连 Alpine 这种冷门环境都有musllinux_1_2的 tag 兜底。真正让一个模型多种设备成立的是训练端的统一架构。Needle 3 在 needle/model/architecture.py 中被定义为 Laddered Simple Attention Network用 Monarch Hadamard MLP 取代 FFNGQA 注意力叠加因果卷积抽头以 gather 方式读取 engram n-gram 记忆并通过多车道超连接组织 20 层网络。关键在于它训练了从 2 层到 20 层的每一个深度——ladder_layer_indices用二分法生成确定性的嵌套子网络每一层深度都是一个可部署的模型。于是手表跑 2 层、手机跑 8 层、机器人跑满 20 层不再需要三套训练流程同一个 checkpoint 切成不同深度即可。README 里那句121M 模型只做 50M 的算术量正是这套设计的卖点大部分参数躺在 engram 记忆表里按需 gather而不是参与每步的矩阵乘。28MB 内存预算下能做什么、不能做什么社区对 Needle 2 的实测数据是稳定占用 28MB 内存45M 参数、14MB.cact文件、W4A8 量化权重 4-bit、激活 8-bit、KV cache 压到 int8。这套数字不是靠单一技巧堆出来的而是内存预算在整个栈上被逐级规划的结果。首先看 KV cache。在 needle/model/architecture.py 里有一个硬约束KV_BUDGET_BYTES 11 * 1024 * 1024 512 * 1024即约 11.5MB 的 KV 预算上限。kv_budget_window根据这个预算反推可用的上下文窗口——对全注意力层按KV_GROUP32对齐截断对滑动窗口模型则把窗口外的注意力全部交给少数global_layers。也就是说上下文长度不是一个自由参数而是给你多少内存模型就算出能跑多长。这解释了为什么 Needle 面对超长对话会主动退化它宁可缩短窗口也绝不让内存越界。其次看量化。导出时权重按行预转置为 [out, in] 布局使 GEMV/GEMM 的归约轴连续量化组沿归约轴切分张量按层优先排列单层的计算工作集在内存中连续进一步降低 cache miss。needle/model/quantize.py 里的 CQCactus Quants采用 Walsh-Hadamard 旋转 Lloyd-Max 码本的组合量化解码时w (codebook[idx] * norm) H一次重建而 1-bit 与 1.58-bit 的码本干脆是解析解不需要额外存储。权重 4-bit、激活 8-bit 的配置在训练时通过fake_quant以 straight-through 方式注入保证量化不是事后补救而是训练时就对齐的。那么 28MB 内存预算下能做什么答案是 Agent 的完整闭环工具调用、结构化抽取、文本 embedding以及语音入口。README 展示了最核心的用法——给函数签名加一个装饰器run()自动完成理解意图 → 填参数 → 执行 → 返回结果import needle needle.tool def get_weather(city: str): Get the current weather for a city. return {city: city, temp_c: 27, sky: clear} agent needle.Needle(tools[get_weather]) print(agent.run(whats it like in Lagos right now?)[results])注意这里不是生成 JSON 文本而是语法约束下的结构化生成从你的 schema 编译出字节级 grammar约束每一个 token因此输出必然可解析——引擎返回的就是一个带function_calls、reasoning、confidence三字段的 JSON 信封。仓库还内置了六个验收环境needle/environments/smart_home.py、kitchen_appliance.py、wearable.py 等每个环境都带冻结的测试集包含缺失参数必须拒绝越界数值必须拒绝否定请求不得执行多任务并行调用等关键用例——这正是工具调用模型区别于聊天模型的地方。不能做什么同样清晰。README 明说它用通用聊天能力换取在手机工具调用上击败 10 倍规模模型、在抽取上追平 2–3 倍规模模型。社区对 Needle 2 的源码走读还指出三个不可变更部分置信度头未参与 LoRA 训练微调后其校准失效必须报confidenceNoneSentencePiece 分词器硬编码在.cact归档内不可替换非英语 token 数会膨胀约 1.7 倍.cact权重与 C 引擎版本强绑定。此外needle/init.py 的 grounding 校验揭示了另一层不做_annotate_ungrounded会扫描输出中的数字与日期参数凡是用户输入里没有出现过的数值——比如模型自己编造的150%亮度——都会被标记为 ungrounded 并在严格模式下拒绝执行_source_years则负责从自然语言中提取年份防止模型把date:参数填成幻觉日期。加上run()循环里max_steps对多轮工具调用的上限控制这套模型在不该动的时候表现得比大模型更克制而这恰恰是设备端 Agent 最需要的行为契约。从演示到量产端侧 AI Agent 还有多远先看社区热度与产出的差距。公开资料显示 Needle 2 已覆盖的工程实践包括Android/Linux 端的 ONNX/TFLite 转换与 Runtime Mobile 集成、气隙无网络设备的三类引擎落盘方式、异步推理与功耗控制、--platform-tag跨平台拉取。仓库里这些能力大多有对应实现needle fetch --platform-tag支持为另一台设备拉取构建needle/_worker.py 用子进程协议隔离微调模型的推理避免污染主进程needle/_telemetry.py 提供NEEDLE_TELEMETRY0与DO_NOT_TRACK1的隐私开关needle/playground/server.py 则把整个推理器搬进浏览器——wasm与wasm-component平台让端侧部署甚至不需要安装任何东西。从能跑到能量产微调链路是关键一环仓库给了两条路径。本地路径needle finetune只训练注意力五张投影矩阵q_proj、k_proj、v_proj、gate_proj、out_proj见 needle/model/finetune.py 的LORA_TARGETS的 LoRA 适配器基座冻结、导出时合并置信度头保持不动平台路径needle platform finetune则做全模型训练覆盖从 2 层起的每个深度并用原始数据集加固防遗忘。README 给出的证据是在 DroidCall 上微调后每个子网络提升 18–36 个点从 4 层起微调子网即可超过 DeepSeek V4 Flash而起点只有 29M 参数。这意味着手表级模型不是做不出来的妥协品而是经过微调后可以逼近桌面级模型工具调用能力的专用件。部署侧needle build --platform linux-arm64 --layers 8 --out ./pi一条命令就能为树莓派生成引擎 8 层权重的完整目录同一引擎还能加载 Whistle——一个 16.9MB 的语音转写模型与 Needle 共用.cact容器、量化方案和 C 引擎单次调用即可完成音频进、工具调用出音频全程不出设备。加上 README 中每种部署目标都附带预编译引擎启动时加载needle3.cact的描述这套权重一份、引擎按平台分发的模型已经在形态上非常接近量产 SDK。距离真正的量产剩下的更多是工程与生态问题而非架构问题。分词器不可替换限制了非英语场景needle.Needle(tools[...], generation2)的兼容层说明新旧引擎要长期并行维护DO_NOT_TRACK环境变量则提醒出海设备还要过隐私合规这一关。但方向上Needle 给出的答案是明确的端侧 Agent 不必等待更强的芯片它只需要把模型缩小到内存预算能装下、语法约束能兜住、行为契约能验证的程度。当 14MB 的模型能在一台手表上完成听懂语音 → 识别意图 → 精确填参 → 拒绝幻觉的完整循环时端侧 AI Agent 的竞争就不再是参数的军备竞赛而是谁先把足够小和足够可靠同时做出来。【免费下载链接】needleAutomation foundation model for tiny devices: 2-bit, 8-29 MB, tool calls, ASR, structured extraction and embeddings on phones, wearables, smart homes, robots, cars and microcontrollers.项目地址: https://gitcode.com/GitHub_Trending/needle20/needle创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于恒美微站

恒美微站专注于为个体商户、工作室提供极简自助建站服务,让每个人都能轻松拥有专业网站。

快速链接

  • 关于我们
  • 建站服务
  • 主题模板
  • 案例展示
  • 资讯中心

服务项目

  • 可视化建站
  • 拖拽编辑
  • 主题定制
  • SEO 优化
  • 网站托管

联系方式

  • 📍 地址:北京市朝阳区建国路 88 号
  • 📞 电话:400-888-8888
  • ✉️ 邮箱:info@hmyw.cn
  • 🕐 时间:周一至周日 9:00-18:00

© 2024 恒美微站 hmyw.cn 版权所有 | 京 ICP 备 12345678 号