你实际看到的是什么

「意大利脑腐」是一个迷因类型,围绕超现实的 AI 生成角色构建,每一个都是一只动物和某个完全不相关的东西的融合 —— 一辆交通工具、一块水果、一件家居物品。最知名的:Bombardiro Crocodilo(一只鳄鱼和一架战斗机或轰炸机融合)、Tralalero Tralala(一条穿运动鞋的鲨鱼),以及 Tung Tung Tung Sahur,还有一个不断壮大的其他角色阵容。每个角色都有一个编造的、听起来像意大利语的名字,和一段以一本正经、伪纪录片式嗓音念出的短旁白 —— 幽默来自用完全的真诚去对待某个荒诞的东西,和一个自然纪录片旁白在描述一个虚构物种时是同样的笑话结构。这些都不是真实的意大利民间传说;「意大利」这个框架本身就是这个段子的一部分。

这些角色实际是怎么做出来的

这个类型背后没有像手办潮流和 Gemini 那样的单一官方工具。典型的制作链条是三个各自独立、普通的步骤叠在一起:一个 AI 图像生成器产出角色设计(在提示词里描述具体的动物-物体融合),一个 AI 语音或文字转语音工具以那个类型标志性的一本正经语调生成旁白,基础视频剪辑软件把静态图像和音轨合在一起,有时加一点轻微的平移/缩放运动,或几张相关图像的幻灯片。值得注意的是,这个类型的大部分根本不需要 AI 视频生成器 —— 一张静态图像加旁白加简单剪辑就能得到整个东西。

它为什么传播得这么广

三件事叠加在一起:即使没有视频上下文,音频标志也能立刻辨识(光凭旁白风格你就知道是这个类型),视觉概念一句话就能描述,而且 —— 最重要的 —— 任何人都真正容易二创。挑一只新动物、一个新的不相关物体、编一个新的听起来像意大利语的名字,你就往那个大家已经认识的共享宇宙里加了一个角色。制作一个「新」的这个低门槛,加上一个简单到孩子和随手创作者都能做的格式,正是把少数几个原创角色变成一个持续进行的完整类型、而不是一个一周后就淡出的视频的原因。

做你自己的

  1. 挑两个不相关的东西。 一只动物,一个和它毫无关系的物体/交通工具/食物。
  2. 精确描述这个融合。 点名哪些部分来自哪个 —— 这个类型的视觉标志倾向于略微诡异、半写实的渲染,而不是卡通风格,所以要明确指定。
  3. 编一个名字。 听起来像意大利语、有节奏、读出来顺口 —— 那个语调比任何实际含义都重要。
  4. 加旁白。 一个设成严肃、一本正经语气的文字转语音工具,像自然纪录片描述一个真实物种那样描述这个角色。
  5. 合成它。 图像加音频,你想要的话加点轻微的运动,导出为一段简短视频。

如果你想在别处复用你的角色

一旦你生成了一张角色图像(或从你做好的视频里导出一帧),背景就内嵌在里面,没有单独的抠图 —— 和本站每个其他 AI 图像或视频输出一样。如果你想只要角色本身,做成贴纸、GIF 循环或叠加层,那是一个去背步骤:RemoveGifBG 处理静态图像、GIF 和视频,并交回一个透明结果。

免费试用 RemoveGifBG

相关:AI 手办潮流 · AI 视频是怎么做出来的 · 什么是生成式 AI?

常见问题

什么是「意大利脑腐」?

这是一个网络迷因类型,围绕超现实的 AI 生成角色构建,这些角色把一只动物和一个不相关的物体融合在一起,被起了编造的、听起来像意大利语的名字,并配上一种一本正经、伪纪录片式的旁白风格。Bombardiro Crocodilo(一只鳄鱼和一架战斗机融合)、Tralalero Tralala(一条穿运动鞋的鲨鱼)和 Tung Tung Tung Sahur 是最知名的几个。这些名字和角色都不是真实的意大利民间传说 —— 「意大利」这个框架本身就是笑点的一部分,模仿老派自然纪录片的语调。

这些角色到底是怎么做的?

通常是一个 AI 图像生成器产出角色设计(动物-物体的融合),一个 AI 语音/文字转语音工具以这个类型标志性的一本正经的纪录片语调生成旁白,然后一段简短视频把图像和音频以及简单的运动或幻灯片式剪辑合在一起。它的大部分根本不需要 AI 视频生成器 —— 一张静态图像加旁白加基础剪辑软件就够了。

为什么这变得这么流行?

这个类型结合了荒诞派幽默、一个容易辨识的音画标志(即使脱离上下文,旁白风格也能立刻认出),以及一个任何人都真正容易二创的格式 —— 换一个新的动物-物体组合和一个新的编造名字,你就有了同一个宇宙里的一个新角色。正是这种可二创性,把它从少数几个原创角色变成了一个有几十种变体的、完整可辨识的类型。

我怎么做一个这种风格的自己的角色?

挑两个不相关的东西(一只动物加一个物体、交通工具或食物),并清楚地向一个 AI 图像生成器描述这个融合 —— 指定一种略微诡异、半写实的渲染风格,而不是卡通的样子,因为这个类型的视觉标志倾向于看起来几乎能以假乱真的图像。用一个文字转语音工具以一本正经、严肃的语气加旁白,然后把图像和音频合成一段简短视频。