产品简介
Berkeley RDI 于 2026 年 9 月开源了 CUA-Lite,一个面向计算机使用智能体(computer-use agent)的开放开发与评测平台。所谓计算机使用智能体,就是能像人一样操作桌面软件、浏览器和手机 App 的 AI,OpenAI、Anthropic、Qwen 等厂商的 CUA 类模型是这一赛道的代表。过去这类开发链路高度碎片化:每个环境有各自的接口和运行时,每份监督数据集的格式不同,每个模型的动作空间与提示格式也不一样,把模型接进环境往往要反复重写同一套代码。CUA-Lite 用三个标准化抽象把这三件事统一起来。
Lite.Gym 是统一的环境接口,把 OSWorld、WebArena、AndroidWorld、WebGym 等 15 个以上基准收敛成一套 reset、step、close 循环,统一了截图观察与 click、type、tap、swipe 动作空间;Lite.Sample 是统一的监督数据格式,已把 Mind2Web、GUIOdyssey 等 10 多个数据集预处理后免费发布在 Hugging Face;每个模型族配一个 harness,同一套代码贯穿评测、SFT 与 RL 三个环节,目前支持 GPT、Claude、Qwen、Gemini 等 14 个模型族。
CUA-Lite 最实在的贡献是免虚拟机的桌面沙箱:用 Docker 容器复刻 OSWorld 桌面环境,不需要 /dev/kvm 这类硬件虚拟化,任何装了 Docker 的主机都能跑,内置 3 万多个可验证训练任务,Lite.OSWorld 还能原样运行 OSWorld 官方任务与评测器。官方已发布横跨 13 个 agent、325 个任务的排行榜(gpt-5.5 以 72.3% 居首,Qwen3.5-27B 以 46.2% 居开源第一),评测结果可一键复现。
核心功能
- 三个标准化抽象:Lite.Gym 统一环境接口、Lite.Sample 统一监督数据格式、每个模型一个 harness,同一套代码贯穿评测、SFT 与 RL。
- 15+ 基准即插即用:OSWorld、WebArena、AndroidWorld、WebGym 等桌面、浏览器、移动端基准走同一套 reset、step、close 接口。
- 免虚拟机桌面沙箱:Docker 容器复刻 OSWorld 桌面,无需 KVM 硬件虚拟化,内置 3 万多个可验证训练任务,Lite.OSWorld 可原样跑官方任务。
- 10+ 数据集免费开放:Mind2Web、GUIOdyssey 等语料预处理为 Lite.Sample 格式,连同前沿 CUA 的 rollout 数据免费发布在 Hugging Face。
- 14 个模型族 harness:GPT、Claude、Qwen、Gemini 等接入即跑,SFT 阶段模型看到的提示词与实时 rollout 完全一致。
- 一键评测与训练:rollout.py 用 --model-id 与 --env-id 组合任意 agent 与基准,同一 harness 支持 GRPO 等强化学习训练。
适合谁用
以下类型的用户会特别受益于 CUA-Lite:
- CUA 智能体横向评测:在同一接口下对比 GPT、Claude、Qwen 系模型在 OSWorld、WebArena 等基准上的表现
- 低成本数据生产:免 KVM 的 Docker 沙箱加 3 万多个任务,个人开发者也能批量跑 rollout 收集轨迹
- 开源模型微调:下载 Hugging Face 语料,用统一 adapter 转成目标模型的 SFT 训练格式
- 复现公开排行榜:官方 13 agent、325 任务排行结果可一键复现,作为采购或选型的对比依据
- 扩展自有环境:按统一接口接入新环境或新数据集,让整个社区的 agent 都能在其上评测与训练
优点亮点
- 真正开放:开源协议,数据集免费上 Hugging Face,不锁定任何模型或厂商
- 免 VM 沙箱显著降低门槛:不需要 GPU 或 KVM 硬件虚拟化,有 Docker 即可跑
- 一套代码三处复用:评测、SFT、RL 共享 harness,避免为每个环节重复造轮子
- 全平台覆盖:桌面、浏览器、移动端 15 个以上基准收敛到统一抽象
- Berkeley RDI 出品,学术社区可信度与持续维护有保障
- 提供可复现的公开排行榜,模型横向比较有统一标尺
价格与方案
完全开源免费,数据集在 Hugging Face 公开下载,评测环境与模型适配代码均为开源组件。
总结与建议
CUA-Lite 是 Berkeley RDI 开源的计算机使用智能体开发平台,用 Lite.Gym、Lite.Sample 与模型 harness 三套抽象统一了环境、数据与训练链路,让任意模型接入任意基准不必重写代码。免虚拟机桌面沙箱与 3 万多个可验证任务是其区别于同类开源项目的关键,适合研究机构与开发者进行 CUA 智能体的评测、微调与强化学习。