融了4000万美金的AI音乐产品,做出的歌到底啥样?

融了4000万美金的AI音乐产品,做出的歌到底啥样?

作者|樊雅婷

微信|FFF111f__

最近,你大概率听过 papi酱的《Oh My God》,也可能在网约车上被动听了一路低沉男声的激情翻唱。

又或许,你还刷到过这样的抽象视频:用一种很魔性的调子唱出聊天记录。

自动播放

AI 音乐,已无处不在。

尽管之前,短视频平台上就已经充斥着 AI 音乐,但它们仍然属于“音乐”的范畴,目标是用情绪化和洗脑的词曲,搭配视频扩大传播,且不希望让人听出来是 AI 做的。

但现在不一样了,AI 音乐成了人人可套用、可二创、可传播的内容玩法。换句话说,普通人把 AI 音乐玩成了“特效模板”。

这也让 AI 音乐成为一个很“奇怪”的创业赛道。一方面,竞争不如通用模型和 Agent 那么激烈,由此带来的市场关注度有限;另一方面,用户正真金白银地参与共创。

ACE 就是其中的一个特殊样本。

当不少 AI 应用还在盈亏线上仰卧起坐时,ACE 已有 10 万付费用户、月收入 200 万美元,并完成 Pre-B 轮融资。Hans Zimmer、Teddy Riley、Martin Garrix 以及多位格莱美获奖制作人,都在使用它的产品。

据悉,ACE 近日完成新一轮近 4000 万美元融资,本轮由头部战投、CCV、顺为资本、Alphaist 等机构投资,多个老股东超额跟投。至此,ACE 成为 AI 音乐赛道融资额最高的华人创业团队。

这家长期服务专业音乐人、深耕 AI 原生音乐生产工具的公司,正计划在原有业务之外新增一款“玩音乐”的产品,miya.fm,一个主打 AI 音乐新玩法的 Agent。

想了解 ACE,我们先看它的第一个产品——ACE Studio。它究竟凭什么吸引一众知名创作者?

ACE Studio,专业音乐人的“高精度武器”

先上成品。

自动播放

可以听出,这首弦乐声部分工明确,主旋律突出,乐器之间配合得很克制,最终效果很能打。

如此宏大的音乐,和我第一次打开 ACE 的感受完全相反。产品简洁朴素,没有 readme,说明文档藏在右下角小图标里。扑面而来的是一个直接创作的音频分轨界面。

你可以点击下方中间的按钮使用产品内置的 160 多种免版税 AI 声线和40 多种 AI 乐器,还可以使用声线克隆、随机灵感等 AI 功能。

除此之外,似乎和传统的音乐编辑器没什么太大区别。CEO 郭靖自己也说,这不是一个“不言自明”的产品。

不过,这套产品思路对专业创作者而言完全成立。他们不需要花哨的页面和冗余功能,只在乎顶级的可控性。所谓可控,是指产品能否在功能层面让创作者完全掌控创作,并精准呈现细粒度表达。

AI 功能在这里的价值,是替代传统音乐制作中高成本、重复性的步骤。

比如开头那段弦乐成品,就是直接把 MIDI 或 MusicXML 文件拖进 ACE Studio,为轨道选择“小提琴”“大提琴”等 AI 音色,它就会按照写好的音符自动演奏。此外,还能开启乐器的 Unison 模式,按需调节每件乐器的音量、时间偏移和立体声宽度。

又或者,只需在钢琴卷帘中输入旋律和歌词,就能立刻听到 AI 演唱。如果某个音或某句歌词听起来不对,可以马上修改,调整后的结果也会即时反馈。

自动播放

下面这个视频是更全面的功能展示。除一句话生成外,还可以根据任意片段 AI 生成匹配的人声或乐器、对局部音频进行 AI 改编、支持接入 Codex、Claude Code 等 Agent 直接操作工程......

和过去使用“一句话生成一首歌”产品不同,在 ACE 里,创作不再是一种差不多的感觉,而是真正可以做到随心可控、即时反馈。

自动播放

正是这种对专业创作可控性的追求,让 ACE 在帮助创作者完成细颗粒度表达的同时,积累了高质量的创作数据。反过来,这些用户数据又被用于训练和迭代其音乐模型 ACEx。

互联网并不缺音乐。流媒体、视频网站和公开数据中已有海量完成时作品,模型可以从中学习曲风、结构、音色和演唱方式。但一首最终导出的 MP3,本质上只提供了结果。

在用户授权的前提下,ACE 可以从专业用户的实际创作过程中提取带反馈的 trajectory data:模型生成了什么,用户保留了什么、删除了什么、修改了什么,最终又选择了什么。

另一类数据则关乎 preference ,即同一任务下,用户在不同结果之间的偏好选择。当用户在产品中使用【给我灵感】时,ACE Studio 会提供两首成品。ACE 则会通过一套严苛规则判断这些数据最终能否被保留,例如试听和播放时长、操作步骤数量、最终是否发布、like 数等。

对模型而言,相比 C 端用户模糊的需求和目的性不强的操作,这类数据能显著提升模型能力。CEO 郭靖也将 ACE Studio 称为“天然的高质量数据工厂”。目前,ACE 已积累约 300 万条轨迹数据和约 50 万组偏好数据。

成效也很直观。ACEx 在部分主流音乐 benchmark 上已处于领先水平,单张 A100 生成一首约 4 分钟的歌曲仅需约 30 秒,单位生成成本约为 Suno v5.5 的五分之一。

对 ACE 来说,由于核心音乐模型自研,ACE Studio 当前毛利率约为 90%。

Miya 把音乐从“作品”变成“嘴替”

前面是阳春白雪,接下来看看下里巴人。老规矩,先上作品。提一句,目前 miya 还处于内测阶段。

自动播放

这里,我直接用官方最热门的玩法——生成一首 diss 歌曲。

在 miya.fm 官网主页输入你想 diss 的人或帖子,或复制其 X 用户名,点击【cook it】,即可生成一首歌曲。

还记得文章开头的“唱出聊天记录”吗,大部分旋律都很生硬,歌词和曲调之间基本看不出关系,属于生搬硬套。

但这首《搬运工》的主题是讽刺这个博主只会搬运内容,miya 自动生成的歌词和主题十分贴切,高潮部分选择用重复旋律呈现,非常洗脑。最重要的是,它在视觉呈现上和音乐也十分配合,特效字幕更是手拿把掐,属于是生成完就可以直接发社交媒体了。

又或者,你可以使用官方自带的 skill:rap battle。用法是输入两个阵营、两个观点,或者两个人,就能自动生成一首他们 battle 的 rap 歌曲。官方就有一个【京爷 vs 沪爷】的示例。

歌词犀利且“真实”,咬字清晰。这个调性让人忍不住想到《狂飙》里的高启强和安欣。

自动播放

有意思的是,ACE 专业做音乐出身,如今却选择做普通人的音乐“玩具”,而且切入点选在了 Roast(吐槽),一个高情绪浓度、又天然适合社交传播的切口。

过去,一个人在 X 上看到一条想吐槽的帖子,可能选择在评论区吐槽、做一张 Meme,或转发评论。现在,用户只需输入一个 X 用户名,或直接丢进一条帖子链接,miya 就能根据这些上下文生成一首带吐槽意味的歌。

Miya 并非 ACE 首次尝试 C 端。

ACE 早期做过虚拟歌姬产品,累计用户超 100 万,峰值日活约 20 万。规模起来之后,团队却发现,更明确的需求来自专业音乐人:他们希望将技术用于真实生产,降低制作时间和成本。

ACE Studio 也由此成型。

对 CEO 郭靖来说,miya 依然处在他的舒适区里。郭靖在创业前曾在水果忍者、神庙逃亡、愤怒的小鸟等全民级休闲游戏做产品增长,是一个很擅长“搞活”的人。这也反映了 miya 和 suno 等“一句话生成音乐”产品最开始就不在一个完全相同的赛道上。

从始至终,从 ACE Studio 到 miya,ACE 要做的路线很明确,就是降低音乐创作的门槛,让音乐成为日常表达方式之一。

如果抖音的 slogan 是用视频记录生活,那 miya 就是用音乐表达生活。

押注音乐成为下一种表达方式

很多新内容形态进入大众市场,都不是从“人人突然学会创作”开始。用户不必先成为创作者,再决定使用新媒介。往往是先有足够简单、有趣的玩法,才逐渐习惯用它表达自己。

miya 从 roast 切入是个好选择,但最终要验证的,不是模型能否生成一首好歌,而是普通人是否真的有用音乐表达自己的需求,音乐能否像文字、图片、视频一样,进入日常创作与社交互动。

面向普通用户的 AI 音乐产品已经非常拥挤,除了 Suno、Udio,还有音潮、阿里的 HappyShrimp、网易天音等一批产品。ACE 曾经的优势不会自动转化为胜利。

miya 能否活下来,取决于它能否让用户形成音乐表达习惯,并持续找到新玩法。毕竟,roast 本身并没有太高的壁垒。

不过,即使失败,ACE 依然是不错的专业 AI 音乐公司。如果成功,ACE Studio 就从专业工具变成更大的音乐平台——通过 AI 重塑音乐的生产与消费,成为 AI 时代的 Spotify。

以下是硅星人和 ACE CEO 郭靖的更多对话信息,供大家参考。

硅星人: ACE 一开始做的是专业音乐工具,为什么现在又开始做面向普通用户的 Miya?

CEO 郭靖: 从大的战略方向来说,我们和其他公司没有本质区别,只是路径不同。Udio 也会往 Pro C 走,Suno 也在做 Suno Studio。最后大家会殊途同归。当一个赛道最后大家的产品形态越来越接近,往往意味着行业已经逐渐找到一个 Best Practice。我认为 AI 音乐今天的最优解就是:自己做模型、自己做 Pro C、自己做 C 端。

硅星人: Miya 也是 C 端产品,但看起来和 Suno 的“一句话生成一首歌”不太一样。你们想做的到底是什么?

CEO 郭靖: Suno 的门槛已经非常低了,但它依然是面向“创作者”的。你打开 Suno,它问的是:“今天你想写什么歌?”比如“一首嘻哈混合摇滚的歌”。这仍然是在描述一个创作音乐的需求。

但我们认为,当音乐创作门槛下降得足够低以后,人们最终会发现,音乐可以成为普通人的一种自我表达。比如我的需求可能根本不是“我要创作一首歌”,而是“我今天心情很沮丧”,或者“我想吐槽一个人”。过去普通人不会想到,我可以用音乐表达这些东西。Miya 想做的是这件事情。

硅星人: 为什么你认为音乐比视频更可能诞生下一代 AI-native 内容平台?

CEO 郭靖: 人类历史上,音乐从来没有真正实现过创作门槛的大规模下降。图片、文字、视频都发生了。唯独音乐,在 AI 之前依然主要是专业人士创作的内容形态。但它又和 3D 模型不一样,音乐是每一个普通人每天都在消费、都能够理解、都会被打动的东西。所以这里存在一个巨大的不对称:每个人都听音乐,但历史上只有极少数人在创作音乐。

如果 AI 第一次让所有人都能够创作音乐,为什么不会出现人类历史上第一次真正的“音乐表达爆发”?为什么不会出现音乐的“抖音时刻”?我觉得这个逻辑非常明确。所以我认为 AI 音乐是一个巨大的事情,它未来创造的价值可能是 Spotify 的十倍,甚至可能达到万亿美元级别。