恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
MiMo-V2.6-Flash API 调用实践笔记
首页
资讯中心
/
MiMo-V2.6-Flash API 调用实践笔记
MiMo-V2.6-Flash API 调用实践笔记
发布时间:2026/10/1 8:48:02
摘要本文系统介绍 MiMo-V2.6-Flash 全模态推理模型的 API 接入与使用方法涵盖模型能力与规格、开发环境搭建、API 密钥配置、基础调用与多模态输入、深度思考与流式输出、Function Calling 链式调用、结构化输出、常见报错排查、参数调优以及从其他模型迁移等核心场景并附有可直接运行的代码示例。目录① 模型能力与规格能力一览模型规格② 开发环境搭建与依赖安装前置要求安装 SDK验证安装③ API 密钥获取与配置获取密钥环境变量配置④ 基础调用与多模态输入纯文本对话图像输入⑤ 深度思考模式与流式输出开启思考 流式输出思考模式开关建议⑥ Function Calling 链式调用⑦ 结构化输出⑧ 常见报错与排查重试封装⑨ 参数调优笔记模型选择计费参考降低 token 消耗的方法⑩ 从其他模型迁移参考文档记录 MiMo-V2.6-Flash 模型 API 的接入过程与使用方法涵盖环境搭建、多模态调用、深度思考、工具调用等常见场景的代码示例。① 模型能力与规格MiMo-V2.6-Flash 是一个 Sparse MoE 架构的全模态推理模型支持文本、图像、视频、音频输入文本输出。能力一览能力说明全模态理解文本、图像、视频、音频统一输入深度思考内置思维链推理默认开启工具调用Function Calling联网搜索内置 Web Search结构化输出JSON Schema 约束输出上下文缓存公共前缀缓存流式输出SSE 流式返回模型规格项目参数架构Sparse MoE总参数 / 激活参数309B / 15B路由专家数 / 每次激活256 / 8上下文窗口1M tokens最大输出长度128K tokens输入模态文本、图像、视频、音频输出模态文本限流RPM 100 / TPM 10M② 开发环境搭建与依赖安装前置要求Python 3.9pip安装 SDKAPI 兼容 OpenAI 协议直接使用 OpenAI SDK 调用pip install openai也可以使用 Anthropic SDKpip install anthropic验证安装import openai print(fOpenAI SDK 版本: {openai.__version__})③ API 密钥获取与配置获取密钥打开 MiMo 开放平台控制台platform.xiaomimimo.com登录账号进入 API Keys 页面创建密钥复制密钥形如sk-xxxxx环境变量配置# Linux / macOS export MIMO_API_KEYsk-你的密钥 Windows PowerShell $env:MIMO_API_KEYsk-你的密钥import os from openai import OpenAI client OpenAI( api_keyos.environ.get(MIMO_API_KEY), base_urlhttps://api.xiaomimimo.com/v1 )④ 基础调用与多模态输入纯文本对话import os from openai import OpenAI client OpenAI( api_keyos.environ.get(MIMO_API_KEY), base_urlhttps://api.xiaomimimo.com/v1 ) completion client.chat.completions.create( modelmimo-v2.6-flash, messages[ { role: system, content: You are MiMo, an AI assistant developed by Xiaomi. }, { role: user, content: 请用中文介绍一下你自己 } ], max_completion_tokens1024, streamFalse, extra_body{ thinking: {type: disabled} } ) print(completion.choices[0].message.content)图像输入import base64 with open(demo.jpg, rb) as f: image_b64 base64.b64encode(f.read()).decode(utf-8) completion client.chat.completions.create( modelmimo-v2.6-flash, messages[ { role: user, content: [ {type: text, text: 请用中文描述这张图片里的主要内容}, {type: image_url, image_url: { url: fdata:image/jpeg;base64,{image_b64} }} ] } ], max_completion_tokens1024, extra_body{thinking: {type: disabled}} ) print(completion.choices[0].message.content)⑤ 深度思考模式与流式输出模型默认开启深度思考会先进行内部思维链推理再输出最终回答。开启思考 流式输出completion client.chat.completions.create( modelmimo-v2.6-flash, messages[ {role: user, content: 一个水池有两个进水管和一个出水管单独开甲管 4 小时注满单独开乙管 6 小时注满单独开丙管 12 小时放完。三管齐开几小时注满} ], max_completion_tokens4096, streamTrue, extra_body{thinking: {type: enabled}} ) for chunk in completion: delta chunk.choices[0].delta reasoning getattr(delta, reasoning_content, None) if reasoning: print(f[思考] {reasoning}, end, flushTrue) if delta.content: print(delta.content, end, flushTrue)思考模式开关建议场景建议复杂推理、数学、代码生成开启默认简单问答、格式转换关闭Agent 多轮工具调用开启max_completion_tokens限制的是思考内容 最终回答的总长度复杂任务建议设大一些。⑥ Function Calling 链式调用import json tools [ { type: function, function: { name: get_weather, description: 查询指定城市的天气, parameters: { type: object, properties: { city: {type: string, description: 城市名} }, required: [city] } } } ] def get_weather(city: str) - str: weather_db {北京: 晴 25°C, 上海: 多云 22°C, 广州: 雨 28°C} return weather_db.get(city, f暂无 {city} 的天气数据) messages [{role: user, content: 北京和上海今天天气怎么样}] response client.chat.completions.create( modelmimo-v2.6-flash, messagesmessages, toolstools, extra_body{thinking: {type: enabled}} ) assistant_msg response.choices[0].message messages.append(assistant_msg) if assistant_msg.tool_calls: for tool_call in assistant_msg.tool_calls: func_name tool_call.function.name func_args json.loads(tool_call.function.arguments) result get_weather(**func_args) print(f工具调用 {func_name}({func_args}) → {result}) messages.append({ role: tool, tool_call_id: tool_call.id, content: result }) final client.chat.completions.create( modelmimo-v2.6-flash, messagesmessages, toolstools, extra_body{thinking: {type: enabled}} ) print(final.choices[0].message.content)思考模式下多轮工具调用时模型返回reasoning_content字段回传历史消息需保留该字段否则返回 400 错误。⑦ 结构化输出import json response client.chat.completions.create( modelmimo-v2.6-flash, messages[ {role: user, content: 从以下文本中提取人名和职位张三是工程师李四是设计师王五是产品经理} ], max_completion_tokens1024, extra_body{thinking: {type: disabled}}, response_format{ type: json_schema, json_schema: { name: person_list, strict: True, schema: { type: array, items: { type: object, properties: { name: {type: string}, role: {type: string} }, required: [name, role] } } } } ) data json.loads(response.choices[0].message.content) for person in data: print(f{person[name]} - {person[role]})⑧ 常见报错与排查报错原因解决方案401 UnauthorizedAPI Key 错误重新生成密钥检查环境变量403 Forbidden账号未开通权限确认账号认证状态429 Too Many Requests超出限流加退避重试400 Invalid Argument参数格式错误检查model名称、messages结构400 reasoning_content missing多轮调用未回传 reasoning回传完整 assistant 消息413 Request Too Large输入超长检查是否超过 1M token 限制重试封装import time def safe_call(client, max_retries3, **kwargs): for attempt in range(max_retries): try: return client.chat.completions.create(**kwargs) except Exception as e: if 429 in str(e) and attempt max_retries - 1: wait 2 ** attempt print(f限流{wait}s 后重试...) time.sleep(wait) continue raise raise RuntimeError(重试次数耗尽)⑨ 参数调优笔记模型选择模型 ID特点mimo-v2.6-flash高效推理适合高频调用mimo-v2.6-pro旗舰性能复杂推理mimo-v2.6-pro-ultraspeed超高速模式低延迟计费参考计费项国内国际输入¥1.00 / 百万 tokens$0.14 / 百万 tokens缓存命中输入¥0.02 / 百万 tokens$0.0028 / 百万 tokens输出¥2.00 / 百万 tokens$0.28 / 百万 tokens降低 token 消耗的方法开启上下文缓存重复的系统提示词自动缓存简单任务关闭思考thinking.type: disabled控制上下文长度只传必要的历史消息设置max_completion_tokens限制输出长度# 流式输出 关闭思考 for chunk in client.chat.completions.create( modelmimo-v2.6-flash, messages[{role: user, content: 用三句话解释什么是多模态大模型}], max_completion_tokens200, streamTrue, extra_body{thinking: {type: disabled}} ): if chunk.choices[0].delta.content: print(chunk.choices[0].delta.content, end, flushTrue)⑩ 从其他模型迁移API 兼容 OpenAI 和 Anthropic 协议现有项目修改base_url和model即可切换# OpenAI 原配置 client OpenAI(api_keysk-xxx, base_urlhttps://api.openai.com/v1) # modelgpt-4o 切换为 MiMo client OpenAI(api_keysk-xxx, base_urlhttps://api.xiaomimimo.com/v1) modelmimo-v2.6-flashAnthropic 协议同理from anthropic import Anthropic client Anthropic( api_keyos.environ.get(MIMO_API_KEY), base_urlhttps://api.xiaomimimo.com/anthropic ) response client.messages.create( modelmimo-v2.6-flash, max_tokens1024, messages[{role: user, content: 请介绍一下你自己}], thinking{type: disabled} ) print(response.content[0].text)参考文档官方文档mimo.mi.com/docsAPI 模型列表mimo.mi.com/docs/quick-start/summary/modelOpenAI 兼容接口mimo.mi.com/docs/api/chat/openai-apiAnthropic 兼容接口mimo.mi.com/docs/api/chat/anthropic-api以上内容基于 2026 年 9 月的 API 版本整理具体参数以官方文档为准。