腾讯混元最新一代模型 Hy4 preview 已发布。从目前的实测素材来看,它重点提升了长程 Agent、多步骤任务、代码开发、前端生成和生产力场景的表现。简单来说,Hy4 preview 不只是回答问题,而是更适合连续执行一系列任务,例如理解需求、生成项目、检查配置、选择部署方案,并将网站发布上线。
Hy4 preview 有哪些核心参数和能力提升?
Hy4 preview 是腾讯混元最新一代模型,采用典型的 MoE(混合专家)架构,主要参数信息包括:
- 总参数量:770B;
- 激活参数量:49B;
- 上下文长度:1M;
- 重点增强方向:多步骤 Agent、代码开发和生产力任务。
其中,1M 上下文长度意味着模型能够处理较长的任务上下文。对于需要连续沟通、反复修改、读取项目文件或执行多轮操作的任务来说,较长的上下文有助于模型保持对整体目标的理解。
从体验反馈来看,Hy4 preview 的主要特点可以概括为一句话:前端审美大幅提升,长程任务相对稳定,办公场景也比较实用。
如何最快体验 Hy4 preview?
目前最简单的体验方式,是下载安装 Workbuddy,然后在模型选项中选择 Hy4 preview。
具体使用步骤
- 下载安装 Workbuddy;
- 打开软件并进入模型选择界面;
- 选择 Hy4 preview;
- 输入需要完成的任务,开始体验模型的代码、前端和办公能力。
来源内容显示,Hy4 preview 可免费试用两周;此外,Hy3 也继续免费使用,并持续到9月底。具体可用范围以软件内显示为准。
声音驱动的动效画布,难点在哪里?
很多人会让 AI 生成粒子动效,用来观察模型的物理理解、前端审美和指令遵循能力。但普通粒子动画通常只是随着时间自动变化,真正让画面被声音实时驱动,难度会明显提升。
这次测试提出了一个更复杂的前端任务:制作一个声音驱动的无限画布生成艺术屏保。它需要通过麦克风接收声音,让画面根据说话时的音量、音高和频谱能量变化,形成实时视觉反馈。
理想效果是:用户一开口,画面就随着声音产生变化;当环境安静下来,画面也不能完全停止,而是继续缓慢演化,保持动态效果。
声音驱动画布需要完成哪些效果?
- 麦克风驱动:通过麦克风捕捉声音;
- 音量响应:声音越大,画面变化越明显;
- 音高响应:不同音高对应不同的视觉变化;
- 频谱响应:根据不同频段的能量生成动态效果;
- 无限画布:画面持续演化,不局限于一次性动画;
- 持续运动:即使没有声音,画面也保持缓慢变化;
- 多种风格:包含赛博、玄学、仪式感等视觉方向。
声音驱动艺术屏保的提示词是什么?
测试使用的核心需求是:制作一个纯声音驱动的无限画布生成艺术屏保,要求采用单文件 HTML实现,并通过麦克风驱动画面。整体感觉要像“用声音作画的活体屏保”,用户说话时能够看到炫酷的视觉反馈,安静时画面也能缓慢演化、永不重复、永不静止。
提示词中还要求加入赛博、玄学、仪式感等视觉风格,并设计可以切换的视觉效果,让用户能够通过持续说话,观察画面的变化。
来源内容中一处表述需要注意:前面提到“一共生成了8种风格”,后面的提示词又写成“自行设计3—4种可切换的视觉风格”。这两处要求并不完全一致,实际使用时最好明确到底需要生成8种风格,还是只需要提供3—4种可切换风格,避免模型在数量上产生歧义。
Hy4 preview 能否把前端项目部署到线上?
在声音驱动画布项目完成后,测试继续询问 Workbuddy:这个项目是否可以部署到线上?
随后,AI 对本地项目进行检查,并发现了多个配置了 xxx.qiaomu.ai 的类似域名。接着,它推荐了几个二级域名供选择,然后读取服务器部署 Skill,完成域名解析和网站发布。
整个过程用时约13分钟,最终将网站部署上线。来源中给出的线上地址为:
这个案例体现的并不是单纯的代码生成,而是从本地项目检查、域名选择、部署配置到网站上线的一整套连续操作。对于不熟悉服务器和部署流程的人来说,这类长程 Agent 能力更接近“协助完成项目”,而不只是提供几段代码。
在线鼓机测试,为什么选择 TR-808?
第二个测试项目是制作一个在线多轨 808 鼓机,目标是让用户像玩游戏一样编辑节奏,并支持调整 BPM、添加乐器组件以及导出 WAV 音频。
TR-808 是罗兰公司在1980年推出的经典鼓机,最初使用纯模拟电路生成声音。由于它的声音不像真实鼓声,曾经被许多传统音乐人嫌弃,销量不佳,后来停产。
但在二手市场低价流通后,TR-808 反而成为许多音乐风格的重要基础,影响了Hip-Hop、R&B、House、Techno 以及现代 Trap等音乐制作。
在线 808 鼓机需要实现哪些功能?
测试要求使用 React + Web Audio API 实现一个专业的8音轨、16步进鼓机应用,主要功能包括:
- 8种打击乐器:Kick、Snare、Hi-Hat Closed、Hi-Hat Open、Clap、Tom、Rimshot 和 Crash;
- 实时声音合成:音色通过 Web Audio 的振荡器和噪声滤波算法实时生成;
- 16步进网格:用户可以在网格中点击,点亮或熄灭对应音符;
- 播放指示条:播放时指示条横向扫描,并高亮当前播放位置;
- 节奏控制:支持调整 BPM;
- 音轨编辑:可以添加不同的打击乐器组件;
- 音频导出:支持将制作完成的节奏导出为 WAV 音频。
这个项目同时考验模型的前端交互设计、音频逻辑、实时调度和界面审美。用户不仅要看到一个能播放的页面,还需要像使用真实鼓机一样,点击格子、调整节拍、组合不同鼓点,并获得清晰的播放反馈。
这次实测说明了 Hy4 preview 的哪些特点?
从声音驱动画布和在线鼓机两个案例来看,Hy4 preview 的优势主要集中在三个方面。
第一,前端视觉表现更受重视
声音驱动画布并不是简单显示几个会移动的圆点,而是要求画面具有赛博、玄学和仪式感等不同气质。测试反馈认为,Hy4 preview 的前端审美有明显提升,更容易生成具有视觉冲击力的页面。
第二,连续任务执行更加稳定
从本地项目检查到域名选择,再到读取部署 Skill 并发布网站,整个过程包含多个步骤。AI 需要不断理解前一步的结果,并继续完成下一步。这个案例显示,它在长程任务和多步骤 Agent 操作方面表现较为稳定。
第三,办公和生产力场景更容易落地
无论是制作可交互的前端项目,还是将本地项目发布到线上,都属于比较具体的生产力任务。用户提出目标后,模型可以围绕目标持续推进,而不是停留在概念解释层面。
如何理解这次测试?
这次测试没有停留在“模型能不能写出代码”这个问题上,而是进一步观察它能否把一个想法变成可交互的作品,再把作品发布到线上。声音驱动画布关注的是视觉创意和实时交互,在线鼓机关注的是音频合成、节奏编辑和前端操作,两者都需要模型同时处理多个技术环节。
当然,来源内容主要展示了项目效果和操作过程,并没有提供完整的代码、详细部署配置或所有测试结果。因此,本文只据此总结其测试方向和已披露的体验反馈,不对未展示的功能细节作额外判断。
我认为:AI 真正有价值的地方,不只是替人写下一段代码,而是把一个模糊的念头,慢慢推到能运行、能交互、甚至能上线的程度。过去人们常说“想法很重要”,如今还要再加一句:想法若不能落地,终究只是脑中的回声。模型能否在漫长的任务里不丢目标,能否把细节一件件接上,才是它从聊天工具走向生产力助手的关键。人若只把 AI 当作自动打字机,得到的也许只是更多文字;若把它当作一起做事的工具,才可能真正省下时间,把手伸向更远的地方。
#React
© 版权声明
文章版权归作者所有,未经允许请勿转载。







