多模型 × 具身智能 评测工作台

让机器人团队 5 分钟看清 7 个模型的真实差距

同一个具身任务指令(机械臂规划 / 导航 / ROS2 代码 / 视觉理解), GPT-4o、Claude、豆包、DeepSeek、通义、Gemini、GLM 七个模型并发流式输出, 内置具身安全约束模板与专项评测,选型又快又省。

🤖 机械臂抓取规划🧭 移动机器人导航💻 ROS2 代码生成👁️ 场景视觉理解🔄 任务失败恢复🛡️ 安全约束规则
7
主流大模型并发
6
具身任务场景
SSE
流式实时输出
1min
Vercel 一键上线

① 多模型实时对比工作台

一个指令,7 个模型并发流式作答。对比机器人任务规划 / 代码 / 安全约束,谁强谁弱一目了然。

选择模型3/7
具身任务模板:
快捷示例:
0 字 · 已选 3 个模型
🎮 当前为演示模式:回答由本地模拟生成,用于预览界面与完整流程。 在 .env.local 或 Vercel 环境变量中配置任一模型的 API Key 后,取消勾选「演示模式」即可切换为真实模型并发输出。
豆包 1.5 Pro字节跳动 · 火山引擎
VLM国产
等待
等待任务下发……勾选该模型后输入指令即可并发生成。
DeepSeek V3深度求索
国产
等待
等待任务下发……勾选该模型后输入指令即可并发生成。
通义千问 Qwen-Max阿里云 · 百炼
VLM国产
等待
等待任务下发……勾选该模型后输入指令即可并发生成。

② 具身智能专项评测

用标准化具身任务(规划 / 代码 / 视觉 / 容错 / 安全)批量压测选中的模型,自动评分 + 排序推荐。 评分基于关键词与结构启发式,仅供参考,选型请结合人工评审

评测模型
评测题目
3 模型 × 6

③ 模型选型雷达图

6 维能力画像。默认参考分为编辑推荐值,可拖动下方滑块按你的场景权重调整,用于技术选型汇报。

选择模型

性价比之王,中文与速度优秀,适合高频实时决策场景。

任务规划代码生成视觉理解安全约束中文能力响应速度
任务规划8
代码生成8
视觉理解8
安全约束7
中文能力9
响应速度9
豆包 1.5 Pro 综合能力分: 49/60
按当前权重得分排序: GPT-4o > Claude 3.5 Sonnet > 豆包 1.5 Pro

⑤ 具身模型选型决策助手

回答 4 个场景问题,直接给你推荐模型 Top3 + 每日成本测算 + 选型报告。 给老板/客户汇报用,一条命令都不用懂。

① 机器人类型
② 核心任务
③ 调用频率
④ 每日运行时长8 小时
⑤ 预算敏感度
单次输入 Token
单次输出 Token
🥇 豆包 1.5 Pro推荐
79
  • · 中文能力强(9/10)
  • · 支持视觉(VLM)
  • · 每日成本低
  • · 国产 · 接入方便
每日成本 ¥290.30
🥈 DeepSeek V3
76
  • · 代码生成强(9/10)
  • · 不支持视觉
  • · 每日成本低
  • · 国产 · 接入方便
每日成本 ¥161.28
🥉 GPT-4o
75
  • · 任务规划强(9/10)
  • · 支持视觉(VLM)
  • · 每日成本适中
每日成本 ¥1451.52
💡 豆包 1.5 Pro 最贴合你的场景(机械臂·规划):中文能力强(9/10);支持视觉(VLM)。预估每日成本约 ¥290.30,比最贵方案每月省约 ¥47450.88
🔬 最近实测数据(自动并入报告)来自 ①对比工作台 / ②具身评测

还没有实测记录。先去 ①对比工作台 跑一次 模型对比,或去 ②具身评测 跑一次评测, 复制选型报告时会自动带上这些实测证据(建议 + 证据)。

全部模型每日成本测算
模型能力分综合分每日成本月度成本(30天)
豆包 1.5 Pro推荐8079¥290.30¥8709
DeepSeek V37676¥161.28¥4838
GPT-4o8575¥1451.52¥43546
Gemini 2.5 Pro7975¥760.32¥22810
通义千问 Qwen-Max7870¥1324.80¥39744
Claude 3.5 Sonnet8469¥2090.88¥62726
GLM-46858¥1872.00¥56160
成本口径:1次/秒 × 8小时/天 × (800输入 + 500输出)token · 价格为参考价,请以官方定价为准。

⑤ 成本与延迟速查

元 / 百万 token(输入·输出),用于高频实时决策场景算账。 参考价,部署前请以各厂商官方定价页为准。

模型厂商输入(元/M)输出(元/M)典型轮次成本*首字延迟VLM适用场景
DeepSeek V3深度求索28≈¥0.0044≈0.8s推理逻辑与中文极佳,成本行业最低,是评测打分/批量场景的首选。
豆包 1.5 Pro字节跳动 · 火山引擎3.614.4≈¥0.0079≈0.6s性价比之王,中文与速度优秀,适合高频实时决策场景。
Gemini 2.5 ProGoogle840≈¥0.0208≈1.4s百万级长上下文与多模态理解,适合场景描述→规划的复杂任务。
通义千问 Qwen-Max阿里云 · 百炼2060≈¥0.0360≈1.1s国产综合能力强,阿里生态接入方便,VLA 开源生态丰富。
GPT-4oOpenAI1872≈¥0.0396≈1.2sOpenAI 旗舰多模态模型,任务规划与代码综合能力第一梯队。
GLM-4智谱 AI5050≈¥0.0500≈1.0s智谱自研大模型,中文与代码均衡,开放平台接入简单。
Claude 3.5 SonnetAnthropic22110≈¥0.0572≈1.5s代码生成与复杂推理见长,安全对齐表现优秀,适合 ROS 代码场景。
* 典型轮次成本 = 输入 600 token + 输出 400 token 的估算价。价格随官方调整变化,仅作量级参考。
💡 高频实时决策(10Hz)

优先看成本档与首字延迟:豆包 / DeepSeek 为默认首选,单次决策成本低一个量级。

🛡️ 安全关键任务

ROS2 代码 / 安全规则生成优先 Claude(安全对齐强),上线前必须人工评审。

👁️ 视觉场景理解

需要看懂相机画面的任务选 GPT-4o / Gemini / 豆包 / 通义等 VLM 模型。