本版 Windows 仅经 CI 冒烟验收,未经界面验收。
Windows 正式包已通过 CI 的 1.4 覆盖升级、桌面启动、本地视频制作,以及新安装 wheel 的人物检测和中文字体检查。macOS 正式包通过本机签名、内置后端启动、人物取景、中文字体和片尾出片检查。本次尚未完成 24/48 小时观察期,按维护者本次尽快正式发布的要求,在上述验收与发行资产核验通过后转为 latest。
后端最终回归 1106 passed / 2 skipped,前端 198 passed;两项 CLI 发布阻塞(人物模型漏包、YouTube 长视频候选排序导致无任务等待)已修复并复测。桌面、CLI 和 MCP 均为 1.5.0,使用同一 tag 的源码;若已安装早期 1.5.0 候选 wheel,请按 ZIP 内 README 强制重装。
AutoClip Desktop v1.5.0
- CLI / MCP wheel 补齐人物检测 ONNX 和 MIT 许可证,修复竖版取景回退;CI 从安装包重新检测真实素材,并校验中文 ASS 字体。macOS 修正随包字体名称匹配,避免中文字幕显示方框。
新增
- 一键出片:贴一个视频链接、选好要发的平台(抖音、小红书、TikTok、Reels、YouTube Shorts、B 站、YouTube),自动挑出值得发的片段,按每个平台的画幅、时长和包装直接生成可发布成片;可随时追加平台版本,失败的单条可重试。
- 两套包装模板:抖音 / 小红书用「访谈式」(上方两行标题、4:3 说话人窗口、中英双语字幕、左下名牌、编辑点评标签);TikTok / Reels / Shorts 用「播客式」(全屏跟随说话人、逐词高亮字幕、开头一句 hook、名牌)。外语素材自动翻成目标平台的语言;原片自带字幕时保留完整画面,字幕放在画面下方。
- 按内容情绪变换风格:模型判断每段内容的情绪(冷静、严肃、强观点、真诚、轻松),据此在 7 套配色和多种字幕动效里挑选,不同片段风格各异,同一片段在各平台保持一致。
- 每个平台先生成最好的 10 条:长视频会挑出 20–40 个片段,先按目标平台的时长要求筛选,再自动生成评分最高的 10 条,其余列为「备选片段」,点「生成这条」再制作,省时间也省模型费用。
- 每条成片自带发布包:按目标平台写好标题、简介和话题(抖音钩子式、小红书笔记式、B 站信息完整、TikTok / Reels / Shorts 英文文案),按平台字数与话题数限制;封面在成片完成后自动设计——说话人画面、成片同款标题与配色、嘉宾名牌,按平台比例(竖屏 9:16、小红书 3:4、B 站 16:10、YouTube 16:9)。成片卡片上可直接改文案、复制、导出「发布包」(视频 + 封面 + 文案),也可以一键用 AI 重新设计封面;去发布时自动带上这套文案与封面。
- 新片尾动画:1.8 秒的 AutoClip 标志动画与提示音,竖屏、横屏各一版,其他比例自动居中适配。
- 竖屏成片按说话人自动取景,主持人与嘉宾切换时画面跟着说话的人走。
- 新增赞助合作伙伴 88API:八语 README、首页与设置页推荐入口、独立 API Key、模型发现、兼容封面与 Whisper 转写;CLI / MCP 使用
api88。 - 模型设置新增赞助合作伙伴「Infistar 无限星河」:接口地址已预设,填好 Key 后自动列出账号可用的模型;设置页提供专属注册链接(可领 $5 体验额度)和接入说明。CLI / MCP 支持
--provider infistar与INFISTAR_API_KEY。 - 设置 → AI 模型重新整理为「AI 服务 / 字幕转写 / 封面 / 高级」四段:选一家服务、填好 Key,分析模型自动选好;画面识别首次配置默认开启,注明适合游戏画面、口播较少的内容;封面默认免费自动设计,自己选好生图服务和模型后才用 AI 生成。从 1.4 升级的用户:1.4 首次配置时自动打开的 AI 封面会改回自动设计(已选的模型保留,在设置里选「AI 生成」即可恢复),不会在后台自动按张计费。供应商分组中的赞助伙伴改为「推荐」。
- 首次打开应用会弹出「连接 AI 服务」引导,未连接时导入会提示先去连接;不再需要自己摸索设置页。
- 首页空状态提供「用示例项目看看效果」:一键生成一个带来源链接的已完成示例项目(Sam Altman 访谈三段),可以直接进编辑器、渲染、生成封面、导出,体验完整流程。
- Studio 编辑器:字幕改为整条成片统一的四种样式(带预览);片头文字降为可选并用视觉缩略图选择;播放器始终跟随滚动可见;预览播放条改为成片自身的时间轴。
- 竖屏「满屏」构图新增按镜头自动取景:先识别镜头切换,再对准正在说话的人;引用卡、PPT 等没有人物的镜头自动改为完整画面 + 模糊背景,不再被裁掉两侧。首次使用需下载约 45 MB 的人物识别组件;每个镜头都可以单独改为「对准人物 / 完整画面」并微调位置。
改进
- 客户端补齐发布包保存、AI 封面结果、单条重试、竖版版式与实际片尾的匿名统计,便于发现生成失败与降级;关闭统计后停止观察。
- CLI / MCP 同步接入一键出片:按平台生成视频、封面、发布文案与 ZIP 发布包,支持查询进度,版本统一为 1.5.0。
- 竖版成片可选「按平台默认 / 访谈式(人物窗口)/ 播客式(满屏)」,字幕和文案语言仍按平台;追加平台和备选片段继承选择。
- 设置页增加「自动添加品牌片尾」开关,默认开启;修改自动成片后重新导出也会保留片尾。
- 出片速度大幅提升:一条 2 小时访谈从链接到成片,由约 65 分钟缩短到 7–8 分钟(视频有作者字幕时)或约 30 分钟(需要本地语音识别时)。片段挑选改为一次通读全文,原来几十次模型调用、半小时以上,现在一分钟以内;各步骤的模型调用并行执行;视频有作者上传的字幕时直接使用,不再本地语音识别。
- 云端语音识别更快:选用云端转写时,音频分段并行上传识别,一条近 3 小时的中文访谈约 4 分钟转写完(本地 Whisper 约 23 分钟);阿里云百炼连接支持填写专属接口地址。
- 封面更清晰、不认错人:从成片里挑嘉宾最清晰的画面(有视觉模型时由它确认是哪位嘉宾),名牌只标在确认过的嘉宾身上,不再把主持人标成嘉宾;英文长标题自动换行放大。AI 封面不让模型自己写人名,名牌由我们叠加;生成后核对标题文字,写错会重试,仍不对就保留自动设计的封面;按平台比例生成,不再裁掉标题或留出上下黑边。成片卡片上直接显示完整封面。
- 模型费用更低:一条 2–3 小时访谈的模型费用由约 ¥0.6 降到 ¥0.1–0.2(qwen-plus 估算),模型调用由近 200 次降到 30 次左右;同语言包装不再让模型复述整段字幕。
- 更安静:成片用电脑自带的硬件编码器(macOS VideoToolbox、Windows NVENC / QSV / AMF),CPU 占用约降到原来的四分之一,风扇不再狂转;硬件编码不可用时自动改用软件编码。
- 切点更自然:片段从问题或观点的第一句开始,到回答讲完、说话人有明显停顿时才结束;按原片音频的真实停顿下刀,不再带进半句下一段话或主持人的下一个问题。
- 导入确认页去掉重复的分析方式提问,控件和文案与设置页统一;发布页和编辑器的「烧录」「标题卡」等术语换成直白说法,编辑器和导出对话框补上封面入口,发布页默认自动生成封面。
修复
- YouTube 长视频先筛选至少 180 秒的完整片段,再选前十,避免被高分短片段挤成备选后一直等待;没有可执行任务时明确结束,CLI / MCP 不再停在 rendering。
- 横版长字幕不再整段铺满画面;各画幅按字号分屏,单屏最多两行,截取长字幕中段不会重新播放前面的整段文字。
- 成片卡片只保留「复制发布文案」,复制内容不附产品署名;AI 重新设计封面使用当前平台的设计流程,重复点击不会重复生成。
- 发布包和桌面下载改为逐段写入文件,长视频不再在内存里整份复制;下载失败会移除残缺文件。
- 外语素材原片烧有英文字幕时,抖音版也会配中文字幕。
- 原片已有硬字幕时,按目标平台判断是否加字幕:中文硬字幕投抖音不再重复加中文字幕,投 TikTok 加英文;外语访谈配了英文硬字幕的,投 TikTok 不再重复。细小、无描边的硬字幕(常见于 B 站访谈)也能识别。
- YouTube 偶尔只给 360p 画质时会自动换方式重新下载到 720p 以上,不再出模糊成片。
- TikTok / Reels / Shorts / YouTube 版本只用英文:标题、字幕、发布文案和封面都不再混入中文;原片没有字幕时一定补上英文字幕;原片烧有中文字幕时,英文版会模糊掉那一条字幕带,再配上英文字幕,并照常跟随说话人取景。台标、PPT 文字不再被误认成原片字幕。
- 一键出片的项目里不再多出一排打不开的原始切片卡片(这些切片没有单独的视频文件,预览、下载都会失败);原始切片仍在「来源片段」里,可以拿来做新成片。
- 同语言字幕与声音同步;电影感字幕改为一次 2–5 个词,不再一个词一个词跳。
- 标题不再出现 Markdown 符号或
&之类的转义字符;中文平台不会出现日文标题;包装偶发不合规时会自动重试一次,不再整段退回原字幕。 - 时间线重试只使用本次有效结果,避免失败后误用上次候选;原始响应缓存现在会正常解析,无效缓存不会自动触发模型请求。
- 智能导入后台任务提交失败后可明确重试,已有方案、草稿和成片保留;修改方案失败时同步恢复偏好。
- 时间线兼容常见时间戳格式;相邻短片段在丢弃前尝试合并,保留既有时长限制。
- 保留的旧导入组件支持更多 YouTube 分享链接格式;当前 Studio 入口增加独立链接回归覆盖。
- Windows 覆盖安装前会结束旧版本残留的后端进程,不再报「无法打开要写入的文件 _asyncio.pyd」;应用内更新先停后端再安装。
- 链接导入把内置 ffmpeg 交给下载器,Windows 上合并音视频不再失败;下载阶段显示真实百分比,不再长时间停在同一个进度。
- 测试使用临时数据库,不再清空开发者本机的
data/autoclip.db。
安全
- 本地后端只接受 AutoClip 自己界面的跨域请求,其他网页不能再读取设置里的 API Key 或发起导入、发布;桌面端拒绝非本机 Host,防 DNS 重绑定。
- 调试路由默认不再挂载(
AUTOCLIP_ENABLE_DEBUG_ROUTES=1开启);python -m backend.main默认只监听 127.0.0.1。 - Docker 从局域网 IP 或自定义域名打开前端时,需要在
AUTOCLIP_ALLOWED_ORIGINS里加上前端地址(逗号分隔)。
下载 / Download
| 平台 | 文件 | 首次打开 |
|---|---|---|
| macOS(Apple Silicon) | AutoClip.Desktop_1.5.0_aarch64.dmg
| 未公证:右键应用 → 打开 |
| Windows 10/11 x64 | AutoClip.Desktop_1.5.0_x64-setup.exe
| 未签名:SmartScreen → 更多信息 → 仍要运行 |
| CLI / MCP(Python 3.11+) | autoclip-1.5.0-cli-mcp.zip / .whl
| ZIP 内含安装与模型配置说明,需 FFmpeg |
两个包都内置便携 Python 与静态 ffmpeg,不需要预装任何东西;Windows 安装包按用户安装,不需要管理员权限,缺 WebView2 会自动下载。
Intel Mac / Linux 暂无安装包,请用 Docker(DOCKER.md)或 pip install -e . 跑 autoclip CLI。
Built-in portable Python + static ffmpeg, nothing to install. macOS build is ad-hoc signed (right-click → Open on first launch);
Windows build is unsigned (SmartScreen → More info → Run anyway). If a file is missing, that platform's build failed for this tag — see the Desktop Build workflow run.
反馈 / Feedback
- 已知问题与当前状态:#96 · 能复现的故障走 Issue 模板 · 想法与用法走 Discussions