整个 8 月,大模型的更新节奏依旧让人喘不过气。

DeepSeek 相继更新 V4-Flash 和 V4 Pro,千问推出新一代旗舰 Qwen3.8-Max,智谱也在月中发布 GLM-5.3,前两天智谱和千问也同时掏出自己 Flash 模型试图刷新斩杀线……

在更加疯狂的 9 月到来之前,腾讯混元也压哨交卷了——Hy4 Preview 正式发布。

图片

四个月前,姚顺雨发布 Hy3 Preview 的时候,把 Hy3 称之为混元大模型重建的第一步。

就在 Hy4 发布前,腾讯集团高级执行副总裁汤道生也回应外界腾讯做 AI 慢了的质疑。

他说,一点不焦虑是不可能的。混元经历了多个阶段、多次重构,而公司整体算力的严重不足,也确实拖慢了模型训练和产品发展。

但他同时提到,在姚顺雨和研究团队的推进下,Hy4 会迎来更多突破与更大的进步。

飞书文档 - 图片

那这次发布的 Hy4 Preview 到底有什么进步,APPSO 这就给你实测看看。

飞书文档 - 图片

姚顺雨此前反复提到一个思路,比起把模型训练成更会刷榜的做题家,混元更关心它到了真实场景里到底好不好用。

到了 Hy4 Preview ,还是这个路线,但是模型本身的尺寸明显大了一圈。总参数量达到了 770B,激活参数为 49B。

上一代 Hy3 Preview 的总参数只有 295B,激活参数是 21B。Hy4 Preview几乎翻了两倍多。

Hy4 Preview 这次把 agent 的长程执行能力又提升了一个档次。所以,APPSO 把它丢进了两个更真实的使用场景体验——写代码,以及日常办公。

Coding Agent 进入国模第一梯队了吗?

时至今日,编程能力依然是各家大模型正面交锋的战场。

这次腾讯新一代大模型 Hy4,在通用能力基础的提升上, 进一步强化了长链路复杂工程的任务完成能力。

在官方给出工程任务盲测中,Hy4 preview 甚至不输 GLM-5.3 和 Kimi K3,它真的进入国模第一梯队了吗?

来看看 Hy4 preview 的具体表现。

本文转自:凤凰网科技

原文地址: https://tech.ifeng.com/c/8vvp3hGbXrw