### [可灵 4.0 定档 10 月,通义语音降价最高 95%:卷完参数开始卷单价](https://codh.cn/article/151.html) **Published:** 2026-09-30T12:45:07 **Author:** 吃瓜er **Excerpt:** 可灵 4.0 定档 10 月、Flash 已开早鸟,通义发布五款语音模型并把转写价格砍掉九成——两条快讯指向同… 同一周里,[视频](/link-tag/63)和[音频](/link-tag/17)各走了一步:快手可灵宣布 4.0 定档 10 月,Flash 版本已先开小范围早鸟;阿里在云栖大会上把语音模型一次性更新到五个,价格直接砍到最高一折。一个往「一整场戏」走,一个往「白菜价」走,方向看着不同,指向的是同一件事——前一阶段的比拼在参数,这一阶段比的是单价和能不能真的用起来。 ## 30 秒不是重点,可控性才是 9 月 28 日官宣,完整版 10 月上线,Flash 版本同日开放限量体验。规格上最容易被记住的是时长:单次原生生成从上一代的 15 秒拉到 30 秒,翻倍。但对做片子的人来说,时长翻倍远不如「这一条能不能按我的想法走」重要,4.0 真正加的东西在这: - **多关键帧**:单次最多支持 10 张关键帧输入,可以自己设定人物状态、场景变化和情节节点,一个镜头里完成多次转折,不用切开重生成。 - **大场面运镜**:高速运动、连续动作、跟拍、环绕这类大幅镜头运动做了专门升级,稳定性和连贯性按官方说法已达到更专业的标准。 - **口型与声音**:口型匹配精度继续打磨,支持高品质音频与双通道立体声,角色说话不再像后期硬贴上去的。 ## 4K HDR 和 2 分钟续拍,官方写的是「即将上线」 4K 与 1080p 的 10-bit HDR 输出、21:9 超宽画幅,是这次宣传里最抓眼的部分:高反差场景逆光不爆、夜景不糊、霓虹不晕,后期调色空间更宽裕。但要注意官方口径里这两项标注的是「即将上线」——也就是说,10 月首发时它未必同时可用。视频续拍同理,最长可延展到 2 分钟,同样是「即将」。按成品规格排期的项目,建议先留一点余量,别把 4K HDR 当成已经能交付的能力写进排期表。 ## 15 项参考,解决的是「复刻」这个真需求 单次任务最多可组合 15 项多模态参考:10 张图片、5 段视频和 7 个主体。它的用处不只是「更像」,而是让参考素材真正参与生产——可以对原视频里的主体与背景做增加、修改和删除,也能单独调整风格、天气、颜色、材质、景别视角。更实用的一层是创意复刻:模型能分析参考视频的镜头语言和叙事结构,再生成一条全新的商业视频,适配社媒爆款、商品广告、服饰美妆、数码 3C 这类明确场景。提示词侧也放宽了,输入长度提升到 8000 tokens,还会对提示词做补充、扩写与润色。 ## Flash 先放出来,是留给付费用户的尝鲜位 4.0 Flash 从 9 月 28 日起限量开放,面向的是付费会员档位,定位高频创作:更快的生成速度和更低的单次成本。完整版要等 10 月,而截至目前,官方还没有公布 4.0 的最终价格、积分消耗与对外的 API 模型标识。这意味着现在适合做的事是「先跑通手感」,不适合把生产链路整体迁过去——尤其当你依赖 API 调用时,接口与计费都还是未知数。 ## 通义一次发五个模型,把音频拆成了四段能力 阿里这边是 9 月 23 日云栖大会上的动作,本周被行业刊物重新汇总后又被讨论了一轮。原有的语音转写、语音合成、实时语音交互三类模型全部升级,另外新增两个:音频理解模型和音频创作模型,合计五款,凑成一套「理解—生成—交互—创作」的完整音频栈。几个值得记的点: - **转写**:多语种与方言识别、上下文理解增强,还加了原生转写润色——自动去掉语气词和重复表达并重组语义,输出的文字不用再人工顺一遍。 - **音频理解**:能理解人物情绪、环境声与机械声,可以做声音描述、事件定位、音频问答与推理,「这段录音里对方的情绪怎么样」这种问题它能直接答。 - **音频创作**:语言模型加扩散模型的统一生成框架,一次生成人声、音效和背景声,有声书、播客、游戏、广告这类需要三层声音叠在一起的活儿最省事;支持 86 个非语言标签、16 种语言和 20 个中文方言区,单次最长 3 分钟。 - **实时交互**:更会接话、更会共情,还能主动调用 Agent 工具完成任务;上下文窗口开到 26 万 token 级别,长会话不用反复搬运上下文。配套的开源框架也一并放出,开发者可以直接搭面向场景的实时语音 Agent。 ## 降价幅度里,ASR 的 95% 最要命 全线降价,其中语音合成降约 70%、实时交互降约 85%、语音转写最高降 95%。按公开定价折算,实时交互版在北京区域大约是每百万 token 文本输入 0.69 美元、音频输入 5.5 美元、音频输出 20.6 美元(境外区域略高)。三段降幅里最有杀伤力的是转写——语音转写是所有音频应用里最走量的一环,会议纪要、客服质检、播客字幕、视频字幕都靠它,成本基线被重设之后,靠转写差价活着的产品要重新算账。合成与实时交互的降价幅度小一些,但同样把「能不能规模化」这道题的答案改了。 ## 写在最后 视频这边的压力是明摆着的:字节的 Seedance 2.5 七月上线后口碑很高,成了不少创作者的首选,阿里与 MiniMax 的视频产品也在用性价比抢人。可灵今年七月刚完成独立融资,规模约 30 亿美元、投后估值约 180 亿美元,带着对赌条款加速跑,4.0 提前放风、Flash 抢先开测,节奏是被竞争推着走的。两条快讯合起来看,行业的着力点已经很清楚:不再是「谁的分数更高」,而是「同样的活儿谁更便宜、谁更能按我的想法来」。对使用者来说,眼下最务实的动作是把免费或低价额度跑一遍,等价格与接口落地再决定要不要换栈。 **Tags:** AI视频创作 **Categories:** AI快讯 ---