马斯克扬言1亿美元AI重拍《奥德赛》 技术解构怎么用大模型制作
基斯杜化·路兰(又译:克里斯托弗·路兰 / Christopher Nolan)执导的史诗大片《奥德赛》(The Odyssey),于2026 年 8 月 10 日在全球票房冲破 2.64 亿美元。这部由麦特·戴蒙(又译:马特·达蒙 / Matt Damon)主演的巨作,在影评网站获得了高达 97% 的好评。然而,科技巨头马斯克(Elon Musk)却站在了喝采声的对立面。
马斯克不仅多次在 X(前身为 Twitter)公开呛声,指责路兰“失去了原则、只想拿奖”,更投下重磅炸弹:他愿意出资 1 亿美元(约 7.8 亿港元)重拍这部古希腊史诗,甚至宣告将在今年内透过旗下的 AI 平台推出完全由 AI 生成的忠实原著版本。
马斯克为何怒斥路兰《奥德赛》?核心争议有哪些?
马斯克对这部荷里活巨作的不满,并非源自特效或剧本结构,而是聚焦于荷里活近年备受争议的“政治正确(Woke)”选角策略。
这场口水战早于今年初就已埋下伏笔。当时电影公布演员阵容,路兰启用黑人女星雷碧达尼安高(又译:露皮塔·尼永奥 / Lupita Nyong'o)饰演引发特洛伊战争的“世上最美丽女人”海伦(Helen of Troy),同时让跨性别演员艾略特·佩吉(又译:艾伦·佩姬 / Elliot Page)饰演西农(Sinon)。
这一决定立即遭到保守派人士与部分历史爱好者的猛烈挞伐。保守派评论员麦特·华许(Matt Walsh)质疑路兰选角只是为了避免被扣上“种族主义”的帽子,马斯克随即转发并认同这一观点。根据 TheWrap 的追踪报导,马斯克当时直接留言“True”(确实如此),并痛批路兰为了迎合评审而放弃了艺术诚信。
在马斯克眼中,古典史诗被强行套入现代多元平等包容(DEI)框架,破坏了荷马(Homer)原著的历史真实感。
一亿美元+梅尔吉勃逊?马斯克重拍计划的来龙去脉
这场争执在电影上映后达到顶峰。一名 X 用户 @martianwyrdlord 发文提出一个大胆构想:建议马斯克直接提供 1 亿美元给导演梅尔·吉勃逊(又译:梅尔·吉布森 / Mel Gibson),打造一部“考据严谨”的《奥德赛》。这部电影必须还原古希腊战船、盔甲与武器,且全片对白必须直接采用荷马史诗的古希腊语(Homeric Greek)发音。
这则贴文迅速获得广泛关注,而马斯克的回应只有简短的两个字:“I'm down”(我赞成)。
根据 Hindustan Times 的报导,梅尔·吉勃逊过去曾执导《受难记:最后的激情》(The Passion of the Christ)与《阿波卡猎人》(Apocalypto),两部影片皆使用古阿兰语、拉丁语及玛雅语,在处理历史语言与还原古文明风格方面经验丰富。马斯克的一句话,让荷里活传统制片厂感到了前所未有的科技资本压力。
但马斯克并未止步于此。他随即宣布了更为疯狂的计划:旗下 xAI 公司的 AI 平台 Grok Imagine 将在 2026 年底前,制作出一部位于历史考据极致、完全还原荷马艺术精髓的全长 AI 电影。根据 新加坡《联合早报》报导,马斯克还贴出了一段长达 3 分钟的 AI 生成样片,展示主角奥德修斯(Odysseus)与海之女神卡吕普索(Calypso)的对手戏。
一亿美元加 AI 技术,真能拍出同等级数的电影吗?
拿 1 亿美元加上当前最顶级的生成式 AI 技术,是否足以挑战路兰动用实景与 IMAX 胶卷打造的电影质感?答案需要拆成两个层面解析。
1. 资金维度:1 亿美元对于纯 AI 电影将创世界纪录,对实景电影则是“刚刚好”
如果走传统实景拍摄路线,梅尔·吉勃逊当年拍摄《受难记》仅花费 3,000 万美元,《阿波卡猎人》约 4,000 万美元。若有 1 亿美元预算,摒弃昂贵的 Hollywood A-List 明星,将资金全数投入道具造船、实景搭设与历史考据,拍摄一部纯古希腊语电影完全绰绰有余。
但如果这 1 亿美元主要用于“AI 生成+后制辅助”,这将是电影史上预算最高的 AI 电影。目前业界制作一部 2 分钟的顶级 AI 短片成本仅数千美元,1 亿美元的预算足以覆盖超大规模的算力渲染与顶级视觉特效(VFX)团队二次修饰。
2. 技术维度:生成长片依然面临致命瓶颈
尽管预算充足,现阶段(2026 年)纯 AI 电影要达到路兰《奥德赛》的院线史诗级质感,依然存在巨大的技术障碍:
角色与光影一致性(Temporal & Character Consistency): 生成式 AI 可以在单一镜头中呈现惊艳的古希腊战船,但在 120 分钟的长片中,要维持主角奥德修斯面部特征、盔甲纹理、甚至光影方向在数千个镜头中完全一致,现有模型仍极易出现“跳张”与变形。
物理引擎与大规模群展: 荷马史诗包含大量的特洛伊海战、巨浪冲击与神话怪兽(如独眼巨人)。生成式影片在处理复杂流体力学(海浪、火焰)与多人肢体碰撞时,往往会展现出违反物理常识的软绵感。
表演细节与情感传达: 路兰电影之所以动人,全靠顶级演员微小的面部肌肉抽动与眼神交流。AI 合成的虚拟角色目前仍难逃“不自然谷(Uncanny Valley)”效应。
根据 台湾《TechNews 科技新报》报导,尽管马斯克释出的 3 分钟 Grok 试片引发关注,但许多视觉特效专家指出,要将片段延伸为 2 小时的叙事长片,技术难度呈指数级上升。
马斯克的 AI《奥德赛》需要动用哪些大模型技术栈?
如果马斯克真要在今年底兑现承诺,他的团队不可能仅依赖单一模型,而是需要组合一套涵盖文本、视觉、语音与 3D 渲染的复合型 AI 技术栈(AI Stack):
文本与语言模型(LLM):Grok 4.5 / Claude 5 / Gemini 3.6
用途: 剧本分镜拆解、对白编写。为了实现马斯克要求的“古希腊语荷马方言”,LLM 需要对《奥德赛》24 卷原始文本进行字词级别的精确语法解析与镜头语言转译。笔者评估,这部分对AI 来说是最低难度,最轻易的,所以不多说了。
图像生成与风格控制模型:Grok Imagine / Nano Banana系列 / GPT Image 2
用途: 概念设计图与角色设定集。这些模型能够精准还原古希腊迈锡尼文明(Mycenaean civilization)的甲胄细节、青铜器纹理与船只结构,确保每一帧都符合历史考据。以笔者对AI 影片业界的认识,这是比较复杂的一套庞大操作,完全超出一般观众的的想像——其实AI 电影远远不像KOL和媒体吹捧那么简单。
导演和制作团队不仅要对所有人物,是所有!包括每个小人物,都建构一套多角度的图像,仔细描绘其样貌、姿势、身形、服装,细节要深入到眼皮、耳珠。然后再为每个出现的物件,比如武器、战船、武器、食物、桌子、杯子,全部要细节话建立多张、多角度的图片档案资产。无数套人物和物件的“数位图像资产”建立好之后,才能谈下一步“叫图片动起来”。
这过程中,估计可能要生成数千张图片。记住,生成过程中,AI 会犯错,制作团队要不断生成,生到接近完美,生到满意为止。行内称这个过程为“抽卡”,也就是抽幸运卡的意思。今次《奥德赛》要抽到满意为止,估计要生成破万次。目前市面上,可能只有上述三款模型能负担起这个重任。
动态影片生成模型:Grok Imagine Video / Gemini Omni / Seed Dance 2.5
用途: 文字生成影片(T2V)与图像生成影片(I2V)。Grok Imagine 需要调用顶级扩散模型(Diffusion Models),将静态概念图转化为高帧率的连续动作镜头,并结合 3D 深度图(Depth Maps)来维持镜头运动的轨迹感。
一般传媒和自媒体一直吹捧AI短剧制作多么简单,多么廉价,但笔者肯定地告诉你,这是以讹传讹。生成影片做短剧,确实是比用真人便宜,但绝对还不是宣传中便宜那么多。试错的成本是不小的。因为纵使是目前最先进的影片生成模型,仍然会大量出错,AI影片制作团队要聘请不少人手,一齐不停地,不断地“抽卡”,抽到满意为止。5秒画面,可能要生成几十次才能满意。更何况《奥德赛》是超顶级制作,容错率应该是目前最低的制作。绝对不是一两条搞笑AI片或者劣质AI 广告片可以比较。
笔者预计,这部分将会是Elon Musk团队最痛苦的部分,抽卡抽到怀疑人生,抽到眼睛都抽筋,失败,等待,再抽,再等,是毫不意外的事情。
语音合成与口型同步模型:ElevenLabs / Gemini Omni/ Hey Gen
用途: 语音复制与古希腊语配音。利用 ElevenLabs 等工具生成具备古希腊语发音节奏的沉稳配音,并透过口型同步 AI(Lip-sync AI)精准对齐虚拟角色的嘴部动作。
3D 引擎与神经辐射场(NeRF / Gaussian Splatting):Unreal Engine 5
用途: 混合制片(Virtual Production)。光靠 AI 生成影片无法解决复杂运镜,马斯克的团队极可能利用 3D 引擎生成古希腊建筑与海域背景,再将 AI 生成的人物融于其中,以达到院线级的光影融合。
被问及如何看待马斯克的开砲与 AI 重拍计划时,露琵塔·尼咏欧在接受媒体访问时回应得相当干脆:“我们的演员阵容展现了世界的多样性。我不会花时间去思考如何辩解,因为无论我是否回应,批评依然会存在。”
面对烂番茄 97% 的观众好评与破亿的票房实绩,马斯克能否靠著 1 亿美元与 Grok Imagine 在今年底拿出足以撼动荷里活的《奥德赛》,科技界与影坛正等待他交出最终答卷。