① 多模型实时对比工作台
一个指令,7 个模型并发流式作答。对比机器人任务规划 / 代码 / 安全约束,谁强谁弱一目了然。
选择模型3/7
具身任务模板:
快捷示例:
0 字 · 已选 3 个模型
🎮 当前为演示模式:回答由本地模拟生成,用于预览界面与完整流程。 在
.env.local 或 Vercel 环境变量中配置任一模型的 API Key 后,取消勾选「演示模式」即可切换为真实模型并发输出。豆包 1.5 Pro字节跳动 · 火山引擎
VLM国产
等待
等待任务下发……勾选该模型后输入指令即可并发生成。
DeepSeek V3深度求索
国产
等待
等待任务下发……勾选该模型后输入指令即可并发生成。
通义千问 Qwen-Max阿里云 · 百炼
VLM国产
等待
等待任务下发……勾选该模型后输入指令即可并发生成。
② 具身智能专项评测
用标准化具身任务(规划 / 代码 / 视觉 / 容错 / 安全)批量压测选中的模型,自动评分 + 排序推荐。 评分基于关键词与结构启发式,仅供参考,选型请结合人工评审。
评测模型
评测题目
3 模型 × 6 题
③ 模型选型雷达图
6 维能力画像。默认参考分为编辑推荐值,可拖动下方滑块按你的场景权重调整,用于技术选型汇报。
选择模型
性价比之王,中文与速度优秀,适合高频实时决策场景。
任务规划8
代码生成8
视觉理解8
安全约束7
中文能力9
响应速度9
豆包 1.5 Pro 综合能力分: 49/60
按当前权重得分排序: GPT-4o > Claude 3.5 Sonnet > 豆包 1.5 Pro
⑤ 具身模型选型决策助手
回答 4 个场景问题,直接给你推荐模型 Top3 + 每日成本测算 + 选型报告。 给老板/客户汇报用,一条命令都不用懂。
① 机器人类型
② 核心任务
③ 调用频率
④ 每日运行时长8 小时
⑤ 预算敏感度
单次输入 Token
单次输出 Token
🥇 豆包 1.5 Pro推荐
79
- · 中文能力强(9/10)
- · 支持视觉(VLM)
- · 每日成本低
- · 国产 · 接入方便
每日成本 ¥290.30
🥈 DeepSeek V3
76
- · 代码生成强(9/10)
- · 不支持视觉
- · 每日成本低
- · 国产 · 接入方便
每日成本 ¥161.28
🥉 GPT-4o
75
- · 任务规划强(9/10)
- · 支持视觉(VLM)
- · 每日成本适中
每日成本 ¥1451.52
💡 豆包 1.5 Pro 最贴合你的场景(机械臂·规划):中文能力强(9/10);支持视觉(VLM)。预估每日成本约 ¥290.30,比最贵方案每月省约 ¥47450.88。
🔬 最近实测数据(自动并入报告)来自 ①对比工作台 / ②具身评测
还没有实测记录。先去 ①对比工作台 跑一次 模型对比,或去 ②具身评测 跑一次评测, 复制选型报告时会自动带上这些实测证据(建议 + 证据)。
全部模型每日成本测算
| 模型 | 能力分 | 综合分 | 每日成本 | 月度成本(30天) |
|---|---|---|---|---|
| 豆包 1.5 Pro推荐 | 80 | 79 | ¥290.30 | ¥8709 |
| DeepSeek V3 | 76 | 76 | ¥161.28 | ¥4838 |
| GPT-4o | 85 | 75 | ¥1451.52 | ¥43546 |
| Gemini 2.5 Pro | 79 | 75 | ¥760.32 | ¥22810 |
| 通义千问 Qwen-Max | 78 | 70 | ¥1324.80 | ¥39744 |
| Claude 3.5 Sonnet | 84 | 69 | ¥2090.88 | ¥62726 |
| GLM-4 | 68 | 58 | ¥1872.00 | ¥56160 |
成本口径:1次/秒 × 8小时/天 × (800输入 + 500输出)token · 价格为参考价,请以官方定价为准。
⑤ 成本与延迟速查
元 / 百万 token(输入·输出),用于高频实时决策场景算账。 参考价,部署前请以各厂商官方定价页为准。
| 模型 | 厂商 | 输入(元/M) | 输出(元/M) | 典型轮次成本* | 首字延迟 | VLM | 适用场景 |
|---|---|---|---|---|---|---|---|
| DeepSeek V3 | 深度求索 | 2 | 8 | ≈¥0.0044 | ≈0.8s | — | 推理逻辑与中文极佳,成本行业最低,是评测打分/批量场景的首选。 |
| 豆包 1.5 Pro | 字节跳动 · 火山引擎 | 3.6 | 14.4 | ≈¥0.0079 | ≈0.6s | ✓ | 性价比之王,中文与速度优秀,适合高频实时决策场景。 |
| Gemini 2.5 Pro | 8 | 40 | ≈¥0.0208 | ≈1.4s | ✓ | 百万级长上下文与多模态理解,适合场景描述→规划的复杂任务。 | |
| 通义千问 Qwen-Max | 阿里云 · 百炼 | 20 | 60 | ≈¥0.0360 | ≈1.1s | ✓ | 国产综合能力强,阿里生态接入方便,VLA 开源生态丰富。 |
| GPT-4o | OpenAI | 18 | 72 | ≈¥0.0396 | ≈1.2s | ✓ | OpenAI 旗舰多模态模型,任务规划与代码综合能力第一梯队。 |
| GLM-4 | 智谱 AI | 50 | 50 | ≈¥0.0500 | ≈1.0s | — | 智谱自研大模型,中文与代码均衡,开放平台接入简单。 |
| Claude 3.5 Sonnet | Anthropic | 22 | 110 | ≈¥0.0572 | ≈1.5s | ✓ | 代码生成与复杂推理见长,安全对齐表现优秀,适合 ROS 代码场景。 |
* 典型轮次成本 = 输入 600 token + 输出 400 token 的估算价。价格随官方调整变化,仅作量级参考。
💡 高频实时决策(10Hz)
优先看成本档与首字延迟:豆包 / DeepSeek 为默认首选,单次决策成本低一个量级。
🛡️ 安全关键任务
ROS2 代码 / 安全规则生成优先 Claude(安全对齐强),上线前必须人工评审。
👁️ 视觉场景理解
需要看懂相机画面的任务选 GPT-4o / Gemini / 豆包 / 通义等 VLM 模型。