LIBERO-PRO
| 方法 / 模型 | 成功率 |
|---|
| Codex / GPT-6 Astra / low / reasoning | 92.63% |
| Claude Code / Opus-4.7 / max.reasoning | 82.4% |
| RPent Flash Mode | 72.63% |
| Codex / GPT-5.5 / xhigh / reasoning | 72.1% |
| ASPIRE | 61.36% |
| π_RLinf | 50.0% |
| π0.5 | 11.0% |
| AtomVLA | 6.3% |
| X-VLA | 3.8% |
| MolmoAct | 1.5% |
| π0 | 0.3% |
GPT-6 Astra: 92.63% (741/800). RPent Flash Mode / Molmo2-8B: 72.63% (581/800).
完整方法与分项成绩
| 方法 / 模型 | 总体 | Spatial Task | Spatial Swap | Object Task | Object Swap | Goal Task | Goal Swap | Long Task | Long Swap |
|---|
| GPT-6 Astra | 92.63% | 100% | 98% | 100% | 99% | 88% | 99% | 85% | 72% |
| Opus-4.7 / max.reasoning | 82.4% | — | — | — | — | — | — | — | — |
| RPent Flash Mode / Molmo2-8B | 72.63% | 79.00% | 70.00% | 86.00% | 93.00% | 74.00% | 65.00% | 60.00% | 54.00% |
| GPT-5.5 | 72.1% | 81.0% | 69.0% | 94.0% | 91.0% | 75.0% | 66.0% | 52.0% | 49.0% |
| ASPIRE | 61.36% | 60.0% | 51.0% | 95.0% | 98.0% | 45.0% | 81.0% | 38.3% | 22.6% |
| π_RLinf | 50.0% | 42.0% | 59.0% | 71.0% | 78.0% | 45.0% | 42.0% | 49.0% | 14.0% |
| π0.5 | 11.0% | 1.0% | 20.0% | 1.0% | 17.0% | 2.0% | 38.0% | 1.0% | 8.0% |
| AtomVLA | 6.3% | 1.0% | 16.0% | 0.0% | 10.0% | 11.0% | 2.0% | 9.0% | 1.0% |
| X-VLA | 3.8% | 0.0% | 0.0% | 8.0% | 2.0% | 9.0% | 1.0% | 10.0% | 0.0% |
| MolmoAct | 1.5% | 0.0% | 0.0% | 0.0% | 6.0% | 0.0% | 0.0% | 6.0% | 0.0% |
| π0 | 0.3% | 0.0% | 0.0% | 0.0% | 2.0% | 0.0% | 0.0% | 0.0% | 0.0% |
| Cap-X | — | 14.0% | 12.0% | 18.0% | 22.0% | 17.0% | 26.0% | — | — |
| RATS | — | 31.0% | 29.0% | 63.0% | 61.0% | 36.0% | 43.0% | — | — |
ASPIRE:Long Task 和 Long Swap 使用 LIBERO-90 技能库进行 zero-shot 迁移。
GPT-6 Astra:Long Task/Swap 与其余六套件使用各自探索后冻结的 memory 文件快照,评测期间不更新。Overall 合并两个不重叠批次:Long 157/200,加上其余套件 584/600,得到 741/800(92.63%);并非全部回合共享同一份 memory 快照。
LIBERO
| 方法 / 模型 | 成功率 |
|---|
| AtomVLA | 97.0% |
| Claude Code / Opus-4.7 / max.reasoning | 96.0% |
| π_RLinf | 95.3% |
| π0 | 94.2% |
| NORA | 79.5% |
| OpenVLA | 76.5% |
RoboCasa365 · Target50
| 方法 / 模型 | 成功率 |
|---|
| Codex / GPT-6 Astra / low / reasoning | 59.20% |
| Xiaomi-Robotics-1 | 57.4% |
| Codex / GPT-5.5 / xhigh / reasoning | 57.1% |
| Claude Code / Opus-4.7 / max.reasoning | 48.6% |
| WorldDreamer | 35.3% |
| RLDX-1 | 30.0% |
| π0.5 | 16.9% |
| π0 | 14.8% |
RoboCasa365 · Target50 · 完整方法与分项成绩
| 方法 / 模型 | 总体 | Atomic-Seen | Composite-Seen | Composite-Unseen |
|---|
| GPT-6 Astra | 59.20% | 87.78% | 43.75% | 42.50% |
| Xiaomi-Robotics-1 | 57.4% | 80.2% | 57.1% | 32.1% |
| GPT-5.5 | 57.1% | 92.0% | 61.0% | 13.8% |
| Opus-4.7 / max.reasoning | 48.6% | 79.4% | 47.5% | 15.0% |
| WorldDreamer | 35.3% | 66.3% | 26.7% | 9.0% |
| RLDX-1 | 30.0% | 60.0% | 21.3% | 5.0% |
| π0.5 | 16.9% | 39.6% | 7.1% | 1.2% |
| π0 | 14.8% | 34.6% | 6.1% | 1.1% |
RoboTwin
| 方法 / 模型 | 成功率 |
|---|
| Codex / GPT-5.5 / xhigh / reasoning | 62.4% |
| Claude Code / Opus-4.7 / max.reasoning | 58.4% |
| LingBot-VLA | 50.4% |
| π0.5 | 47.9% |
| GR00T-N1.7 | 20.7% |
| StarVLA | 10.6% |