Skip to content

Latest commit

 

History

3 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 

Repository files navigation

OpenHappyHorse

Happy Horse 被描述为一款开源 SOTA AI 视频生成器,具备原生音视频联合生成能力——在单次前向传播中同时生成视频帧与对应音轨(对话、环境音、拟音),而非先生成无声视频再后期配音。 这是一个个人维护的信息收集库OpenHappyHorse,并非 Happy Horse 官方仓库,也不代表官方发布。 本仓库中的所有信息均来自公开渠道(社区架构整理、技术讨论、项目主页等),仅供个人参考与学习。 我与 Happy Horse 团队没有任何关联。官方模型、权重与代码尚未开源。 一旦官方发布,本 README 将第一时间同步更新。

OpenHappyHorse – 快乐骏马 1.0 AI 视频生成器信息收集库

Status License Modality Parameters Architecture


⚠️ 免责声明——请先阅读

这是一个个人信息收集库,并非 Happy Horse 的官方库,也不是公开发布的库。

Happy Horse 1.0 尚未正式开源。目前尚未发布模型权重、推理代码或官方 GitHub 代码库。本 README 文件中的所有内容均来自公开渠道,包括社区整理的架构说明、疑似技术泄露、人工智能分析视频论坛、项目主页以及独立讨论帖,仅供个人参考和学习之用

我与 Happy Horse 团队没有任何关联。 以下信息可能不完整、来源不一致,或随时可能更改。我会密切关注更新,并在官方模型、代码库或技术报告发布后立即同步更新此 README 文件。

👉 有关最新信息,请参阅 Happy Horse AI 视频生成器官方演示和更新


📖 什么是 Happy Horse 1.0?

Happy Horse 1.0 被描述为一款开源的、最先进的 AI 视频生成器,具有原生的音频视频联合生成功能——这意味着 Happy Horse AI 视频模型可以在一次前向传播过程中同时生成视频帧和相应的音轨(对话、环境音、拟音),而不是先生成无声视频,然后再进行配音。

根据社区整理的架构说明,该模型基于一个拥有 150 亿参数的统一自注意力 Transformer 构建,能够处理单个标记序列中的文本、图像、视频和音频标记。据称,该模型没有专用的交叉注意力分支,也没有单独的音频模块。结合 DMD-2 蒸馏技术,该蒸馏后的模型据称可以在 NVIDIA H100 显卡上仅用 8 个去噪步骤,且无需无分类器引导,即可在约 38 秒内生成 1080p 视频

Happy Horse AI 视频生成器最初以 “神秘模型” 的身份出现在 Artificial Analysis Video Arena(人工智能分析视频竞技场)上,与字节跳动、Kling 和谷歌等公司的前沿封闭模型一同匿名亮相。独立社区观察人士注意到,它似乎来自亚洲,而且——与一般的神秘模型不同——它还具备原生音频输出功能。

截至发稿时,官方公告承诺公开版本将包含基础模型、精简的八步模型、超分辨率模块和推理代码。但这些内容尚未发布。您可以关注 Happy Horse 官方平台获取发布信息。


🧱 已报告的架构

以下技术细节来自社区整理的架构笔记和据称泄露的关于 Happy Horse 1.0 的技术资料。所有这些内容均未经官方技术报告或同行评审证实。 在模型正式发布之前,请将其视为合理但未经证实的信息。

组件 报告规格
总参数 约 150 亿
架构 统一的自注意力 Transformer(据称没有专门的交叉注意力分支)
总层数 40 层
层布局 三明治结构——前 4 层和后 4 层使用特定模态的投影;据报道,中间 32 层在所有模态之间共享参数
处理的模态 文本、图像、视频和音频标记——连接成一个单一的标记序列
多模态融合 每个注意力头学习了带有 sigmoid 激活函数的标量门,用于训练稳定性
条件注入 参考图像和去噪信号通过一个极简的统一接口进行路由——据称没有专用的信号处理分支
时间步长处理 据报道,该模型没有显式的时间步嵌入——据说它是直接从输入潜在变量的噪声水平推断去噪状态的
蒸馏 DMD-2(分布匹配蒸馏 v2)
采样步骤 8 步
无分类器引导 据称不需要
推理运行时 MagiCompiler——一种跨 Transformer 层进行算子融合的全图编译技术,据称可提供约 1.2 倍的端到端速度提升
参考 GPU NVIDIA H100 80GB

这些已报道的设计选择为何重要

1. 统一自注意力而非交叉注意力

目前大多数开源视频模型(例如 Wan 2.2、HunyuanVideo、LTX-2 和 CogVideoX)都使用扩散变换器 (DiT) 作为骨干网络,其中文本条件通过来自独立文本编码器的交叉注意力机制注入,而音频(如果有)则完全由另一个模型生成。

据报道,Happy Horse 1.0 完全依赖于统一自注意力机制,将文本、图像、视频和音频放在同一序列中,并让注意力机制处理所有这些信息。据称,这使得模型能够将音视频对齐作为去噪的基本组成部分进行学习,而不是作为下游的修复步骤。

2. 三明治式层结构

据报道,前 4 层和后 4 层分别处理特定模态的嵌入和解码;中间 32 层在所有模态之间共享参数。这种结构的优势在于参数效率——网络的大部分功能都用于跨模态推理,而不是被分割成孤立的子网络。

3. 每个注意力头都采用 sigmoid 门控

联合多模态训练的稳定性极差,因为音频损失的梯度可能主导视频损失的梯度,反之亦然。目前提出的解决方案是:在每个注意力头上学习一个标量门控,使模型能够选择性地抑制在特定模态中产生破坏性梯度的注意力头

4. 无时间步长的去噪

大多数扩散模型会将当前的去噪时间步长作为显式嵌入传递到每一层。据报道,Happy Horse 1.0 完全省略了这一步骤,理由是噪声水平已经编码在噪声潜在变量本身中。这被认为是实现激进的 8 步 DMD-2 去噪的先决条件之一。

5. DMD-2 蒸馏

标准的视频扩散算法通常需要 25-50 个采样步骤,且无需分类器引导,这两种方法都会使推理成本翻倍甚至三倍。DMD-2(分布匹配蒸馏 v2)仅需 8 个步骤即可训练出一个学生模型,使其与教师模型的输出分布相匹配,且无需控制流图 (CFG)。这就是 “约 38 秒内渲染 1080p” 这一说法的依据。


✨ Happy Horse AI 视频生成器的功能介绍

🎬 原生联合音视频生成

这是该技术的主要功能。据称,单个统一的 Transformer 可以同时对视频和音频片段进行降噪处理。对话、拟音和环境音效一次性生成,并与画面完美同步——无需单独的配音或唇形同步模型。

📺 1080p 输出

据称可生成最高 1080p 分辨率、片段长度约为 5-10 秒、具有多种宽高比的视频。

🗣️ 支持 6 种语言的原生唇形同步

根据技术项目描述,Happy Horse 1.0 的唇形同步功能已针对英语、普通话、日语、韩语、德语和法语进行原生训练,且词错误率低。(一个市场推广页面列出了包括粤语在内的 7 种语言——官方数量将在发布时确认。)

⚡ 1080p 分辨率下大约需要 38 秒

使用 NVIDIA H100 显卡和简化版 Happy Horse 模型,报告了实际渲染时间。5 秒 256p 预览视频的渲染时间约为 2 秒

🔄 统一的文本转视频和图像转视频

据报道,Happy Horse 的同一流程中,只需一组权重即可处理文本转视频和图像转视频任务。

📦 开源发布范围

此次发布的版本包括:

  • Happy Horse 1.0 基础模型
  • 精简的 8 步模型
  • 超分辨率模块
  • 推理代码

许可条款尚未公布。


📊 公共基准

AI 视频模型最常被引用的公开基准测试是 Artificial Analysis Video Arena(AVA),它采用盲对决投票的方式计算 Elo 评分。Happy Horse 1.0 曾以代号参与该竞技场的比赛,但截至撰写本文时,它尚未出现在官方公开排行榜上

值得关注的权威排行榜

排行榜 说明
🥊 人工智能分析视频竞技场 盲测对比投票,计算 Elo 评分
📈 人工智能分析文本转视频排行榜 T2V 专项排名
🖼️ 人工智能分析图像转视频排行榜 I2V 专项排名

排名说明:人工智能分析领域的 Elo 评分会随着新投票的不断涌入而持续重新计算,模型的排名可能在一天之内发生数位变动。

当前文本转视频排行榜的顶尖选手(参考快照)

截至本 README 上次更新日期,人工智能分析文本转视频排行榜上的顶尖产品大致分为以下几个等级:

层级 模型 Elo 评分范围
前沿封闭模型 Dreamina Seedance 2.0、SkyReels V4、Kling 3.0、PixVerse V6、Veo 3.1、Runway Gen-4.5 ~1,200–1,275
中等水平封闭模型 Sora 2 Pro、Hailuo 2.3、Wan 2.6、Dimension Q2 ~1,150–1,200
顶级公开权重模型 LTX-2 Pro、LTX-2 Fast、WAN 2.2 A14B ~1,100–1,135
早期公开赛级别 HunyuanVideo 1.5、Wan 2.1 14B、Wan 2.2 5B ~950–1,020

在这个领域,任何达到或超过 LTX-2 水平的开源软件都被视为最先进的开源技术。而处于前沿封闭层级的软件则直接与最优秀的付费 API 竞争。

一旦 Happy Horse 1.0 出现在官方排行榜上,我将在此部分更新其排名信息。


🆚 Happy Horse 1.0 对比 Wan 2.2、LTX-2 和其他开源视频模型

AI 视频社区经常会问,Happy Horse 1.0 与目前领先的开源软件相比如何。根据已公布的规格参数,以下是对比:

特性 Happy Horse 1.0(报告) LTX-2 Pro Wan 2.2 A14B HunyuanVideo 1.5 CogVideoX-5B
参数 约 150 亿 约 130 亿 14B 约 130 亿 5B
骨干 统一自注意力 Transformer DiT DiT DiT DiT
原生音频生成 ✅ 与视频结合
原生唇形同步语言 6 种(报告) 0 0 0 0
采样步骤 8(无 CFG) 约 25 约 50 约 50 约 50
报告 1080p 时间 在 H100 上约 38 秒 数分钟 数分钟 数分钟 数分钟
文本转视频
图像转视频 ✅ 统一
今日是否有公开权重 ❌ 尚未

从纸面上看,Happy Horse 1.0 的主要优势在于其原生音视频联合生成功能。 Wan 2.2、HunyuanVideo、LTX-2 和 CogVideoX 都只能生成无声视频,需要完全独立的音频和唇形同步模型。需要特别注意的是最后一行:所有这些竞争对手都已经发布了权重,而 Happy Horse 1.0 尚未发布。


🎯 可能的应用场景

根据已公布的功能,Happy Horse AI 视频生成器一旦发布,将适用于以下工作流程。但所有这些功能尚未经过实际测试验证。

📱 短视频社交视频

TikTok、Reels 和 Shorts 内容,采用原生音效,无需单独的配音流程。

📢 营销和广告创意

发布预告片、产品宣传片和具有电影般动态效果的高转化率广告创意。

🌍 多语言营销活动

在英语、中文、日语、韩语、德语和法语市场推广单一创意概念,无需重新拍摄。

🎬 B-roll 和 previz

用于电影、电视和 YouTube 制作的场景镜头、概念镜头和动画分镜。

🛍️ 电子商务产品视频

通过图像转视频技术将产品照片转化为动态演示。

🔬 AI 研究

开放权重,用于研究联合音视频扩散、统一多模态 Transformer、DMD-2 蒸馏和无时间步长去噪——一旦发布


❓ 常见问题解答

Happy Horse 1.0 现在是开源的吗?

不。 截至本 README 文件发布时,Happy Horse 模型的权重、推理代码和官方代码库尚未发布。官方宣布该模型 “即将发布” 。本代码库仅用于在正式发布前收集个人信息。

这是 Happy Horse 的官方资源库吗?

不。 这只是我个人收集的公开信息。我与 Happy Horse 团队没有任何关联。如需权威信息,请参考 Happy Horse 官方平台。

Happy Horse 模型的重量数据何时可以下载?

目前尚未公布正式发布日期。Happy Horse 1.0 模型权重、精简版 8 步变体、超分辨率模块和推理代码均已列入已公布的发布范围,但尚未上传。一旦这些内容上线,我将立即更新此 README 文件,您也可以关注 Happy Horse 官方更新频道获取发布信息。

Happy Horse AI 视频生成器采用的是什么架构?

根据社区汇编的架构说明:

  • 150 亿参数
  • 统一自注意力 Transformer
  • 40 层,三明治布局(每端 4 个模态特定层 + 32 个共享中间层)
  • 每个头部 sigmoid 门控
  • 没有专用的交叉注意力分支
  • 没有显式的时间步嵌入
  • DMD-2 蒸馏到 8 个采样步长,无 CFG

Happy Horse 1.0 的速度应该有多快?

据报道:

  • 单个 NVIDIA H100 显卡上,1080p 视频片段:约 38 秒
  • 5 秒 256p 预览视频:约 2 秒

这些数据尚未得到独立验证。

Happy Horse 1.0 将支持哪些语言的唇形同步?

  • 技术说明中列出了 6 种语言:英语、普通话、日语、韩语、德语和法语
  • 另一份市场宣传页面列出了 7 种语言(包括粤语)
  • 最终语言数量将在发布时确认

Happy Horse 1.0 与 Wan 2.2 和 LTX-2 相比如何?

从理论上讲,Happy Horse 1.0 的参数数量与目前顶级开源权重模型(例如 Wan 2.2 A14B 的 140 亿参数和 LTX-2 Pro 的约 130 亿参数)大致相同,但它增加了其他竞争对手所不具备的原生音视频联合生成功能

实际上,Wan 2.2 和 LTX-2 目前已可下载,而 Happy Horse 尚未发布——因此,在正式发布之前,任何直接比较都只是理论上的。

在此期间,我可以在哪里看到 Happy Horse AI 视频生成器?

Happy Horse 模型将使用哪种许可证?

尚未正式发布。 该版本据称完全开源,允许商业用途,但具体的许可证尚未公布

这个 README 文件会更新吗?

是的。 我一直在关注官方网站、AI 分析论坛以及社区讨论。一旦有任何官方更新——例如:

  • 代码库上线
  • 权重上传
  • 论文发表
  • 排行榜更新并包含已验证的 Elo 分数

这份 README 文件都会立即同步更新。


📚 信息来源及更新

本 README 文件根据截至下方日期公开流传的关于 Happy Horse 1.0 的信息编写而成。

官方信息渠道

Happy Horse AI 官方视频生成器网站是实时演示和更新的权威来源。我们在研究过程中发现的所有其他宣传页面均未在此处链接,因为它们属于第三方网站,且其内容有时相互矛盾。

权威的第三方基准

Artificial Analysis Video Arena 及其文本转视频和图像转视频排行榜是本文档中唯一链接的第三方来源,因为它们被广泛认为是 AI 视频模型的标准公共基准


📅 更新日志

日期 状态 说明
2026-04-09 预发布 初始版本,等待官方开源发布

将在以下情况下更新:

  • 官方存储库上线
  • 模型权重发布
  • 技术报告发布
  • 模型出现在公开的 AI 分析排行榜表格中

⭐ 最后的话

这是一个个人信息收集库。Happy Horse 1.0 尚未正式开源——一旦开源,此 README 文件将立即同步更新。

如果您想在有更新时收到通知,请 Star 这个仓库。如果您有关于 Happy Horse 的新公开信息(非泄露、非侵权),欢迎提交 Issue 或 Pull Request。


保持关注。这可能是 2026 年开源 AI 视频领域最重要的发布之一。

About

Happy Horse 被描述为一款开源 SOTA AI 视频生成器,具备原生音视频联合生成能力——在单次前向传播中同时生成视频帧与对应音轨(对话、环境音、拟音),而非先生成无声视频再后期配音。 这是一个个人维护的信息收集库OpenHappyHorse,并非 Happy Horse 官方仓库,也不代表官方发布。 本仓库中的所有信息均来自公开渠道(社区架构整理、技术讨论、项目主页等),仅供个人参考与学习。 我与 Happy Horse 团队没有任何关联。官方模型、权重与代码尚未开源。 一旦官方发布,本 README 将第一时间同步更新。

Resources

Stars

24 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors