三步就能做出IP口播短视频

新手小白不写文案、不出镜、不剪辑也能搞出短视频

一键改写爆款文案
选您的形象与声音
生成成片并批量发布

最近创作

悬停即可静音预览最近生成的竖屏成片

还没有创作记录,点击小助手开始第一条视频吧

我的形象

已注册形象会优先显示,没有形象的槽位保留为预览占位

我的声音

试听已注册的专属音色,创作时可直接调用

更多功能

进入专业短视频制作工具

视频引擎
文案引擎
配音引擎
数字人引擎
数字人形象
点击卡片选中,再次点击取消
生成引擎
悬停或点击查看方案,确认使用后生效
视频底模数字人

视频底模数字人方案是推荐方案,基于视频进行动作和讲话风格学习,生成的数字人活人感强,视频不会被打上“AI水印”。

图片生成数字人

一张照片就能生成数字人讲话,会有自然的动作和手势,但是生成的时间稍长,有一定概率会被平台识别为“AI视频”。

文案输入
0 字
口语化
专业
幽默
激情
温柔
字数 0 字 · 预估时长 0 秒
自由创作 不套用模板
粘贴抖音/快手/B站分享文本,系统自动提取文案(含字幕转写,无需任何配置)
选择已完成的蒸馏报告
随机采用该博主的选题、叙事结构与语言节奏,生成一条原创文案。
暂无可用报告
主标题、副标题和发布文案
可生成后继续修改确认
音色选择
点击卡片选中, 试听音色
语音高级设置
当前音色克隆模型为 正在读取… ,如需更换请到模型设置页面更换音频克隆模型。
提前生成配音
按当前文案、音色和参数生成完整配音;整单任务会直接复用,不再重复合成。您也可以直接跳过,制作视频的时候统一生成音频。
仅保留 3 天
尚未生成
最近配音任务
进入声音设置后会加载最近任务。
字幕样式
字幕样式预设会带出推荐值;之后手动修改的双层/双语开关为最终结果。
背景音乐 (BGM)
视频效果
超级IP智能封面
读取视频设置
当前封面模板
黑金案例拆解封面
默认读取“视频设置”中的封面;在这里修改后会自动同步,并用于本次作品。
自动 B-roll(本次作品)
当前方案读取中
生成模型读取中
最大片段数
单段时长
画面呈现模式
预计最高算力
当前启用状态同步中
正在读取“自动 B-roll”总设置和可用状态...
本页不重复保存;总设置中的下拉菜单和开关会自动同步到这里。
水印
片头片尾
配置汇总
发布目标

勾选已登录账号,成片后将按发布设置自动分发

正在读取可用账号...
未选择账号,仅生成视频 发布仅在桌面端执行
流水线进度
生成结果
视频将在此处展示
标题
最终文案
文案输入
生成设置
流水线进度
生成结果
视频将在此处展示
标题
封面
最终文案
详细信息

          
原始文案
AI 处理
处理结果
使用提示

润色:优化表达,保留原意

仿写:语义级改写,避免查重

扩写:增加细节和案例

缩写:精简压缩,保留核心

风格转换:调整语气风格

主题生成:根据主题创作

已预置 Coding Plan · DeepSeek V4;也可在模型配置中切换自己的模型。

基础设置
选择模块执行
音频产物
执行后展示
视频产物
执行后展示
执行结果
等待执行...
批量文案输入
N 条文案 × 1 组参数 = N 个视频
音乐来自统一云端音乐库;批量任务与“视频设置”使用同一套曲目。
批量进度
0 / 0
提交后将显示每条文案的处理进度
通过闭源视频大模型生成broll
根据文案生成专属画面,按所选模型消耗算力余额
启用
通过无版权素材库生成broll
按文案检索现成视频素材,不消耗闭源视觉模型算力
启用
AI 手绘解释图
适合概念、步骤、知识点与情绪隐喻;不用于还原商品包装、文字或真人外观
启用
Ian 标准模型动效 · 10 秒 适用:抽象概念、步骤、知识点与情绪隐喻
Ian 方案严格使用 Ian Xiaohei Illustrations 原版 Skill(MIT),作者 Ian;配图绑定命中的原文句段与真实字幕时间。
按当前方案确定素材时长
VOX 清爽科技
把知识点、步骤和关键词转成 12fps 分层图形动效;使用现代规整黑体,不使用毛笔字与正红色
启用
10 秒典型案例 适用:知识点、步骤、数据与关键词解释
本地原创渲染,不调用外部视频模型;优先使用真实字幕时间规划插入点。
当前未启用 VOX 清爽科技链路。
关闭时不规划、不渲染。
使用说明
画中画与整段插播
画中画模式(PIP):B-roll 视频以小窗口叠加在数字人画面上,数字人仍可见(适合讲解类)
整段切换模式(CUT):在指定时间段用 B-roll 替换主画面,数字人暂离(适合展示实景素材)
3 种添加入口(不是画面模式):① 点击字幕间的 + 在两段字幕之间添加;② 点击 B-roll 轨道空白处在任意位置添加;③ 点击“在播放头插入”按当前播放位置添加
快捷剪辑:裁剪头尾、调整音量、片头片尾淡入淡出,一键应用
选择任务
B-roll 素材库(我的上传)
点击上传自己的视频或图片
时间轴编辑器
素材来源
请先选择一个任务
选择任务后将显示字幕时间轴
闭源视觉模型算力余额
账户余额与公开计费标准
算力余额 闭源模型算力余额 · 用户剩余算力
新用户默认赠送 20 算力
按次计费 标准模型
1.26 算力起/次
按清晰度与生成时长自动估算
按次计费 性价比模型
0.50 算力/次
支持 6 秒与 10 秒空镜
按时长计费 高端模型
0.86 算力/秒
默认 10 秒约 8.60 算力/条
正在读取用户余额...
注册形象素材上传要求
1、最优方案:上传一段出镜人正面自然说话的视频,手势自然摆动,时长至少10秒以上,30秒最佳,光线明亮柔和。
2、次优方案:上传一段出镜人正面自然念数字的视频,比如:“1234567,7654321”。手势自然摆动,时长至少10秒以上,30秒最佳,光线明亮柔和。
3、基础方案:上传一段出镜人正面照片,光线明亮柔和,支持一张照片生成数字的视频。
注册新形象
点击或拖拽上传照片/视频
支持 JPG/PNG 照片 或 MP4/MOV 视频,建议正面清晰、嘴巴不动
AI 生成形象(720p)
高端模型只允许调用当前账号已认证并审核通过的人脸 ID,不支持在这里临时上传真人照片。
用高端模型 720p 从头像生成 10 秒全身动态参考视频(保留人物长相、按提示词换构图和背景),自动注册为形象。生成一次长期复用,约需 1-3 分钟。
已注册形象
注册新音色
当前音色克隆模型为 正在读取… ,如需更换请到模型设置页面更换音频克隆模型。
样本要求会按模型动态调整
点击或拖拽上传音频
正在读取支持格式…
    已注册音色
    正在连接云端 GPU 工作台…
    新建蒸馏
    检查中

    每位用户赠送 5 次免费蒸馏机会,超出后按 1 元/次计费。

    蒸馏记录
    暂无蒸馏记录
    素材与生成方式
    任务文件保留 3 天

    适合已有口播或音乐的素材,按镜头节奏快速出片。

    单次最多 40 条原始视频、20 个镜头单元;单视频不超过 300 MB,视频与音频总量不超过 2 GB,最多生成 10 条成片。

    尚未选择素材
    多条任务会更换镜头组素材和剪辑节奏。
    支持 MP3、M4A、FLAC、OGG,最大 100 MB。
    任务与成片
    暂无混剪任务
    任务列表

    视频队列 0

    拖拽视频或文件夹到这里开始处理支持 MP4、MOV、MKV、AVI、WEBM,单次最多 6 条
    文件 / 任务信息媒体信息处理参数状态
    还没有任务。添加视频后,这里会显示处理队列。
    处理设置

    参数与算法

    输出位置云端对象存储任务完成后可预览与下载,成片保留 3 天
    分辨率配置跟随源视频自动匹配原片宽高和画面比例
    运行日志

    处理动态

    待命

    素材重生云端工作台已就绪

    待处理任务0
    输出位置云端对象存储最终成片保留 3 天
    提交进度0%
    模型与方案
    在一个输入框里完成模型、素材、链接、复刻方案和生成要求。
    选择参考视频、图片或音频新增卡片会自动 @ 引用
    @ 人脸素材 选择已认证人脸
    人脸素材库选择后会自动加入 @ 引用
    正在加载已认证人脸...
    生成规格
    720p
    提交生成
    任务进度
    提交后自动更新,刷新页面也能继续查看
    等待同步
    暂无进行中的任务
    任务记录
    暂无复刻任务
    场景化创作模板
    每个模板预置了该场景的口播文案骨架、字幕样式、BGM、滤镜、转场、情感、语速。选择场景后填入关键词即可生成完整文案,一键应用全部样式。
    预制数字人形象库
    预制形象可直接选用,搭配推荐音色。想要真人效果,点"换成我的真人形象"上传您的照片或出镜视频——推荐上传 10-30 秒的说话视频,数字人会保留您的头部动作和神态,效果远好于静态照片。
    预制音色库
    基于 Edge TTS 的免费音色,按场景推荐。点击"使用此音色"将设为默认音色。
    样式模板库(字幕/BGM/滤镜/转场)
    任务列表
    任务 ID 状态 创建时间 更新时间 操作
    任务详情
    选择上方任务查看详情
    使用说明
    虚拟人像:用于您拥有商用权的数字角色、AI 角色或非真人形象,提交后等待素材审核。
    真人人像:先打开 H5 完成本人认证,再上传与认证本人一致的正面素材。
    审核状态变为“可用”后会生成该账号专属的人像 ID,可在使用高端模型的功能中选择调用。
    虚拟人像入库
    无需真人认证
    请确认拥有素材商用权;建议上传清晰全身图或正面特写,单张不超过 10 MB。
    真人人脸认证
    尚未认证
    当前账号的人像 ID
    尚未提交人像素材
    本机算力与模型库
    检测中
    正在检测显卡...
    云端服务状态
    检查中
    密钥由云端统一托管
    供应商密钥只配置在 81 认证服务器或云端 GPU 工作服务器;本客户端、安装包和用户电脑均不保存供应商密钥。
    检查中…
    检查中…
    检查中…
    检查中…
    LLM 大语言模型配置
    检查中
    文本大模型由 81 服务器统一提供,客户端不保存模型 API Key。
    TTS 语音合成配置
    检查中
    超先进声音克隆支持高保真音色复刻、自然情绪控制与多语言口播;其他模型可按需要手动切换。
    阿里云系列模型(限时免费):千问 Audio 3.0 Plus、千问 Audio 3.0 Flash、CosyVoice v3.5 Plus、CosyVoice v3.5 Flash
    ASR 语音识别配置
    数字人模型配置
    检查中
    ×
    教学视频即将上线 上传教学视频后将在这里直接播放
    字幕样式
    以下画面由真实照片与最终 ASS 字幕引擎渲染,字体、颜色、描边和排版均为成片效果。
    选择模板会带出推荐值;之后手动修改的双层/双语开关为最终结果。
    背景音乐 (BGM)
    批量处理、开始创作和视频设置共用这一套云端背景音乐。
    视频输出参数
    超级IP智能封面
    自动提取成片代表帧,并结合标题生成封面。
    所选封面模板预览
    黑金案例拆解封面 生成时会保留当前视频人物,并按所选模板重构标题与版式。

    音频、场景与画面效果

    语速、音量、滤镜、转场、水印与片头片尾统一在视频设置中管理。

    高级效果
    发布模式
    平台管理
    发布账号管理
    扫码添加多个平台账号;每个账号独立保存,互不串号
    登录资料只保存在当前电脑,不上传服务器。添加账号时请使用对应平台 App 扫码。
    一键分发
    将成片同时发布到多个平台、多个账号
    选择任务后会自动填入该任务的标题、发布文案和标签,仍可手动修改
    账户概览

    算力分区清晰,消耗一目了然

    口播工厂与专项模型额度相互独立,系统会在真实生成完成后记录实际消耗。

    正在同步算力余额…
    基础算力

    口播工厂

    持续可用
    无限算力

    覆盖日常口播创作流程,不占用专项模型额度。

    数字人口播 文案处理 常规成片
    独立额度,不参与扣减
    专项算力

    闭源模型

    初始赠送 20 算力
    20算力

    高端模型、标准模型、性价比模型与付费声音模型共用此额度。

    自动 B-roll 爆款复刻 AI 带货 付费声音
    仅按真实结果记录消耗

    算力使用说明

    提交任务前了解额度关系,避免创作过程中断。

    额度独立

    口播工厂持续可用,不影响闭源模型算力余额。

    真实扣费

    专项任务只有真实生成并完成处理后,才会记录实际消耗。

    实时同步

    余额以服务端记录为准,可随时刷新查看最新结果。