暂无菜单项

1
发布于 更新于

Holo4 开源:能自己操作电脑的智能体模型,但能商用的那版弱了一半

9 月 28 日,法国 AI 实验室 H Company 发布了 Holo4,一套专用于“操作电脑”的开源权重智能体模型。它能看屏幕点击输入、自己写代码并运行、调用 MCP 或 API,且同一个模型在桌面、网页、Android、代码沙箱和企业 API 上的调用方式完全一致。真正需要留意的不是分数,而是许可证:成绩更好的那个版本不能商用。

发布了什么

Holo4 有两个尺寸,架构并不相同:

  • Holo4-27B:270 亿参数稠密模型,基于 Qwen3.8 构建;
  • Holo4-35B-A3B:350 亿总参数的 MoE 模型,基于 Qwen3.5 MoE 构建。

两者上下文上限都是 262,144 tokens。权重以 BF16、FP8、NVFP4 和 4-bit GGUF 四种格式发布,GGUF 文件可以直接拉进本地运行时。同场还发布了 Holotron4 Nano,一个基于 NVIDIA Nemotron 3 Nano Omni 的小尺寸智能体模型,仅提供 BF16 与 FP8,遵循 NVIDIA 开放模型协议。

H Company 强调的一点是接口统一:多数智能体模型只为单一交互面训练,Holo4 则按任务自动选择走 GUI 还是走代码、MCP 或 API,不需要按平台换模型。

基准成绩与单任务成本

以下均为厂商自测数据,来自 H Company 自己的 harness。

在标准桌面操作基准 OSWorld 上,Holo4-27B 拿到 85.2%、单任务成本 0.08 美元,35B-A3B 为 80.8%、0.05 美元;对照来看,同基座的 Qwen3.8-27B 是 84.3%、0.22 美元。

任务拉长到长流程场景(OSWorld 2.0)后差距立刻显现:27B 得 61.7 分、单任务 1.22 美元,MoE 版只有 30.9 分、0.61 美元。同一组对照里,Opus 5.5 为 81.8%、8.48 美元,GPT-6 Astra 为 73.5%、9.07 美元。换句话说,Holo4-27B 用不到七分之一的单任务成本,拿到了接近前沿闭源模型七到八成的表现。

在面向 API 的业务自动化基准 AutomationBench 上,27B 为 45.4%、MoE 版 34.5%;移动端 AndroidWorld 上两者分别为 85.1% 与 77.6%。

成本是这次最亮的一项:在桌面操作任务上,Holo4-27B 的单任务成本约为 0.08 美元,而同场对照的闭源前沿模型要 8 到 9 美元。H Company 同时公开了全部评测轨迹,可在 Hugging Face 上回放逐条核对。

官方也主动提示了口径问题:AutomationBench 公开集 600 个任务中有 480 个落在其训练数据划分内,在留出 120 题上 27B 版本为 49.3%;且各对比模型的任务子集、harness 与推理 effort 并不一致,目前还没有独立第三方复现。

许可证才是这次的关键

两个尺寸的授权完全不同,这构成了这次发布最现实的一个取舍:

  • Holo4-27B:CC BY-NC 4.0,禁止商用,定位研究用途;
  • Holo4-35B-A3B:Apache 2.0,允许商用。

问题在于,按厂商自己的数据,能直接放进付费产品的 Apache 版本,在长流程桌面任务 OSWorld 2.0 上的分数(30.9%)只有非商用版本(61.7%)的一半左右。要商用就得接受能力折损,要性能就得谈授权——这是眼下选型时绕不开的一步。

API 定价上,27B 为输入 0.40 美元、缓存 0.04 美元、输出 3.00 美元每百万 tokens;35B-A3B 为输入 0.30 美元、缓存 0.03 美元、输出 2.00 美元每百万 tokens。

模型是怎么练出来的

训练分两步。监督微调用了 1270 亿 tokens,其中约四分之三是成功的智能体轨迹,按桌面 45%、网页 14%、MCP 与 API 12%、移动端 3% 分配,其余覆盖多模态推理、GUI 定位与纯文本工具调用。

随后是长时程任务上的异步在线强化学习,分别训出一个桌面与网页专家、一个终端与 MCP/API 专家,两个 LoRA 专家按等权重合并回原模型,不再额外训练。支撑这一流程的是内部的 Agentic Task Factory——一套从文档直接生成可交互环境与可验证任务的流水线,目前已产出约 1 万个任务。

怎么看这次发布

对开发者而言,Holo4 的意义在于把“电脑操作智能体”的成本压到了一个可以随手试错的量级:GGUF 权重可本地跑,API 单任务几分钱,评测轨迹全部可查。对产品方而言,则要先把许可证这道坎算清楚再动手。

同样要保留分寸:以上所有分数来自厂商自测,跨模型的 harness 与 effort 并不统一,尚无独立复现,选型前建议用自己的真实流程跑一遍。

常见问题(FAQ)

Holo4 可以直接用于商业产品吗?
只有 Holo4-35B-A3B 可以,它采用 Apache 2.0 协议。性能更好的 Holo4-27B 采用 CC BY-NC 4.0,禁止商业使用,仅限研究。按厂商自测,可商用版本在长流程桌面基准 OSWorld 2.0 上的得分约为非商用版本的一半,选型时需权衡这点。
Holo4 和其他智能体模型有什么不同?
多数智能体模型只针对单一交互面训练,Holo4 则能在 GUI 点击输入、自写并执行代码、调用 MCP 或 API 之间按任务自动选择,且在桌面、网页、Android、代码沙箱与企业 API 上使用同一模型、同一调用方式。
这些基准分数可信吗?
全部为 H Company 自测数据,使用其自有 harness,取 2 到 4 次运行的均值。厂商自身也提示,各对比模型的任务子集、harness 与推理 effort 并不一致,目前尚无独立第三方复现。不过它公开了全部评测轨迹,可在 Hugging Face 上逐条回放核对。
0 / 600
0 讨论
热门最新
总结
暂无总结