阿里 Happy Horse 1.1 来了:AI 视频开始拼真正可用

2026年6月23日 · 3422 字 · 7 分钟 · Happy Horse 阿里巴巴 AI视频 AIGC 视频生成 音视频生成 Fal.ai

阿里 Happy Horse 1.1 来了:AI 视频开始拼真正可用 封面

AI 视频最近有点像挤牙膏,也有点像短跑。

一边是模型名字越来越多,用户还没记住;另一边是能力确实在往前挪。阿里的 Happy Horse 1.1,就是这种状态。

它不是那种只靠一条 demo 把人吓一跳的更新。真正值得看的地方,是它开始把 AI 视频里最烦人的几件事放到台面上:画面要稳,人物别换脸,商品别变形,声音别像后期随手贴上去。

以前很多视频模型的问题都很一致:第一眼不错,第二眼穿帮,第三眼你就知道不能直接交活。

人物一转身,脸不太对;产品动一下,包装开始糊;多镜头一接,角色像临时换了演员;声音还要再找工具配,口型再单独修。

Happy Horse 1.1 这次打的,正好是这些老毛病。

先说结论

如果你只是偶尔玩一段 AI 视频,1.1 当然是新玩具。

但如果你做短视频、电商素材、广告分镜、社媒内容、数字人口播,或者团队里已经开始用 AI 做视频草稿,那它更像一个可以认真测试的工具

我不想把话说得太满。AI 视频现在离“随便一句话就能稳定出片”还远。

但从 fal.ai 已经公开的 1.1 API 看,它至少把几个生产参数摆出来了:

  • Text-to-Video、Image-to-Video、Reference-to-Video 三个 1.1 入口
  • 720p 和 1080p 输出
  • 3 到 15 秒视频时长
  • 原生同步音频和多语言唇同步
  • Reference-to-Video 最多 9 张参考图
  • API 价格:720p 每秒 0.14 美元,1080p 每秒 0.18 美元

这些参数不花哨,但很实际。

因为真实工作里,创作者最怕的不是模型不会整活。恰恰相反,最怕的是它太会自由发挥,最后没法控制。

1.1 到底更新了什么

先把版本信息说清楚。

fal.ai 当前公开的是 alibaba/happy-horse/v1.1/... 这组端点,不是早期容易误写的 fal-ai/happy-horse/...。1.1 主要有三个入口:

  • alibaba/happy-horse/v1.1/text-to-video
  • alibaba/happy-horse/v1.1/image-to-video
  • alibaba/happy-horse/v1.1/reference-to-video

Text-to-Video 只用文字生成视频。它支持 9 种画幅:16:9、9:16、1:1、4:3、3:4、21:9、9:21、5:4、4:5。这个变化对社媒很有用,尤其是竖屏、横屏、超宽屏要同时测试的时候。

Image-to-Video 是让一张图动起来。1.1 的首帧图片最大 20 MB,图片最短边至少 300px,支持 JPEG、JPG、PNG、BMP、WEBP。这个入口适合把商品图、海报图、人物图先变成一段可看的视频。

**Reference-to-Video 是我更在意的入口。**它允许传 1 到 9 张参考图,提示词里可以用 character1character2 一直到 character9 指代这些图里的主体。图片最短边至少 400px,每张最大 20 MB。

这件事看起来像参数细节,其实很重要。

因为商业内容最怕“差一点像”。一个商品瓶身三秒换一次形状,广告就不能用了;一个数字人每个镜头像换了亲戚,观众马上出戏;一个 IP 角色从正脸到侧脸就变陌生,后面剪辑再强也救不回来。

Reference-to-Video 想解决的不是“生成一段漂亮视频”,而是“围绕同一个人、同一个商品、同一种视觉风格继续生成”。

这才是电商、广告和 IP 内容会在意的地方。

音频这次要单独看

很多人看 AI 视频,第一反应盯着画面。

但真正让一段视频像不像成片,经常是声音。

人物说话时,口型、语气、环境声、镜头节奏只要有一个对不上,画面再漂亮也会显得假。产品落到桌面要有触感,人物走路要有脚步,室内要有一点空间声。少了这些,视频会像一段会动的图片。

fal.ai 对 Happy Horse 1.1 的描述里,明确写了同步原生音频和多语言唇同步。

这意味着它不是只输出静音画面,再让你自己去找配音、音效、对口型工具。它想把画面、动作、对白和环境声放进同一条生成链路里。

说人话:AI 视频不再只是“做画面”,而是在靠近“做片段”。

这对短视频和广告素材尤其有用。很多内容不需要电影级制作,但需要能看、能听、能发,别一开口就露馅。

当然,中文体验还得实测。

“多语言唇同步”写在文档里是一回事,普通话、粤语、不同口音、不同语速下稳不稳,是另一回事。如果你真打算接进业务,最好拿自己的真实素材跑几组,不要只看官方样片。

它为什么被关注

Happy Horse 不是突然冒出来的名字。

2026 年 4 月,《华尔街日报》报道过 HappyHorse 1.0。当时它先以匿名模型身份出现在 Artificial Analysis 的文生视频榜单上,并排到第一,后来阿里方面确认了背后来源。阿里旗下新成立的 AI 相关团队 Token Hub 也提到,当时模型处于内测,并计划开放 API。

这个背景很关键。

1.1 不是从零开始讲故事,而是在 1.0 已经被外部榜单和开发者注意到之后,快速补 API、补多入口、补参考图和音频能力。

视频模型竞争很残酷。画质、动作、镜头、角色一致性、音频、成本、速度,任何一项拖后腿,真实用户都会走。

所以我更关心的不是它某一条 demo 有多惊艳,而是阿里能不能保持这种更新速度。

AI 视频这个赛道,慢半拍就容易被遗忘。

谁最该试

普通用户不用急着判断它是不是“最强”。

更实用的问题是:你有没有这些场景。

电商团队

商品主图、上新短片、场景广告、直播预热视频,都需要大量视频素材。

如果 Reference-to-Video 能稳定保住商品外观,电商团队会最早感受到价值。它不一定替代摄影棚,但可以先生成多版创意,帮你筛方向。

比如同一个香水瓶,试 5 个场景;同一款耳机,试办公室、地铁、健身房;同一件衣服,试不同镜头运动。先看哪条有感觉,再决定要不要精修或实拍。

广告和品牌团队

广告团队要的不是一条视频,而是很多条候选。

不同镜头、不同文案、不同场景、不同人物状态,都要试。AI 视频如果能降低试错成本,前期分镜、创意验证、提案样片都会快很多。

但品牌团队也要更谨慎。

**品牌色、LOGO、包装文字、代言人形象,这些东西不能乱。**Happy Horse 1.1 能不能稳定压住这些细节,要用自己的品牌素材试。

短剧和社媒创作者

短剧创作者最缺的是产能。

人设、镜头、动作、对白、音效,每一项都耗时间。Happy Horse 1.1 如果在人物一致性和唇同步上更稳,至少可以先覆盖概念片、预告片、剧情测试和素材补拍。

我不建议一上来就拿它做完整短剧。

更现实的用法,是先做“够用的小片段”:一个转场,一个人物反应,一个产品氛围镜头,一段旁白口播。把这些边角料补上,剪辑压力会小很多。

产品和运营

AI 视频不只和导演有关。

产品演示、活动预热视频、课程片头、社群宣传、功能说明,都可能用到。以前这些内容经常因为“做起来麻烦”被砍掉。

现在可以先用 AI 出一个版本。

不一定直接发布,但至少能让团队看到效果,减少口头沟通。

现在别急着神化

我会把 Happy Horse 1.1 看成一个值得测试的工具,而不是魔法棒。

几个限制仍然要盯住。

第一,长一点的视频稳不稳。

3 秒好看和 15 秒不崩,是两回事。fal.ai 文档支持 3 到 15 秒,但可用率要看真实任务。

第二,多镜头一致性还要验证。

Reference-to-Video 解决的是单次生成里的参考主体一致性。真正项目里常常要跨多条视频保持同一个角色,这比单条视频更难。

第三,提示词成本不能太高。

如果普通人为了拿到一条可用视频,要写 1000 字提示词、反复调参 20 次,那门槛还是不低

第四,授权和素材规则要看清楚。

fal.ai 页面标注了商业使用入口,但你用真人参考图、品牌素材、商品图生成时,还要看素材授权、肖像权、平台规则和内容安全要求。技术能生成,不等于你一定能放心发布。

第五,中文和中文口播要单独测。

英文 demo 好,不代表中文口型自然。普通话、粤语、方言、快语速,最好都跑一遍。

怎么测试更划算

如果你准备试 Happy Horse 1.1,不建议一上来就写“拍一部赛博朋克史诗大片”。

这种提示词很爽,但测不出工具能不能进流程。

拿真实业务问题测,更快。

电商用户可以看:

  • 同一个商品在 3 个场景里外观是否一致
  • 10 秒视频里包装、LOGO、文字会不会变形
  • 镜头运动时商品边缘和材质会不会糊

内容创作者可以看:

  • 同一个人物连续说两句话,口型是否自然
  • 角色转头、走动、抬手时脸是否稳定
  • 同一提示词多次生成,风格是否可控

团队用户可以看:

  • 拿到一条可用素材平均要生成几次
  • 720p 和 1080p 的真实成本差多少
  • 后期还要补多少剪辑、配音、修图工作

真正的工具评测,不是看最好的一条样片。

而是看你为了拿到一条能用的视频,要废掉多少条

最后带走三点

第一,Happy Horse 1.1 的重点不是单纯“画质更好”,而是把视频生成往可交付方向推。

1080p、3 到 15 秒、原生音频、多语言唇同步、参考图一致性、API 接入,这些能力都很朴素,但都和真实工作有关。

第二,Reference-to-Video 是最值得关注的入口。

最多 9 张参考图,瞄准的是人物、商品和品牌视觉的一致性。对电商和广告来说,这比单段画面炫不炫更重要。

第三,别只看 demo。

**拿自己的素材测。**看它能不能减少沟通、试错和返工。能减少,才叫工具。只能惊艳一次,那还是玩具。


==关注我==,我会继续跟进 AI 视频、AI Agent 和内容生产工具的真实变化,重点看它们到底适合谁用、怎么接进工作流、现在值不值得花钱试。觉得这篇有用,也可以转给正在做短视频、电商素材或品牌内容的朋友。

有帮助👉 「点赞」「转发」「小心心」

也欢迎在评论区聊聊你的 AI 视频体验。