本次更新扩展视频、3D、语音和音乐工具,打通模型配置、本地素材上传、任务等待、结果保存与项目预览,并完善模型设置与文件上传的稳定性。
What's Changed
视频生成
- 正式注册 GenerateVideo 工具,接入 MiniMax H3 / H3 Max 与阿里云 Wan 3.0 Video / Prime;按所选模型能力支持文生视频、首尾帧和参考图片、视频、音频
- 新增“默认视频生成模型”设置,工具配置可单独覆盖默认模型;支持设置时长、分辨率、画幅和保存路径
- 支持工作区相对路径和本地素材,按供应商要求转换为 Base64 或自动上传到 MiniMax / 阿里云临时存储,保留公网 URL 与供应商文件引用
- 单次调用内自动提交、查询任务、下载并保存视频,无需手动传入任务 ID 或重复提交
- 停止时结束本地等待;MiniMax 会核对任务状态并尝试取消仍在排队的任务,运行中的任务无法取消;万相停止等待不会取消云端任务
3D 生成与项目预览
- 新增 Generate3D,接入阿里云 Tripo H3.1 / P1.0,支持文本、单图和 2–4 张不同视角图片生成;在工具配置中选择模型,当前要求北京地域
- 支持本地 JPEG/PNG 素材校验与自动上传,按视角整理多图输入;生成时开启贴图与 PBR 材质,支持模型允许的纹理、几何质量选项
- 自动等待生成完成,保存 GLB 模型和可用预览图;预览图下载失败时保留已保存的模型,停止仅中止本地等待
- 项目文件工作区新增 GLB、glTF、FBX、OBJ、STL 交互式预览,支持旋转、缩放、平移和放大查看
- 3D 查看器新增线框切换,并使用本地生成的环境光照改善材质展示;线框材质独立于共享模型缓存,切换不影响其他预览实例
语音识别、合成与音乐
- 修复 MiniMax 语音识别接入,提供 ASR 1.0 模型;SpeechToText 支持工作区相对路径、音视频转换及文本 / SRT / ASS 输出
- 接入阿里云非实时语音识别,包括 Qwen Audio、Fun ASR、Qwen3 ASR 和 Paraformer 系列;支持同步识别、长音频任务轮询、临时上传和直接读取支持的公网音频 URL
- 根据模型返回的时间戳生成字幕;仅返回文本的 Qwen3 ASR Flash 不生成带时间戳字幕,避免虚构时间信息
- 接入阿里云 Qwen Audio、CosyVoice、Qwen3 TTS 及百炼 MiniMax 语音合成,按地域提供模型列表,支持相应模型的音色与表现指令,合成后保存 WAV 文件
- 阿里云定制音色模型使用已有音色 ID,工具不负责创建或复刻音色;完善空音频检查、停止信号传递和音频时长/采样率展示
- 完善 MusicGeneration,接入 MiniMax Music 3.0 / 2.6,支持歌词、自动生成歌词或纯音乐,生成后下载并保存 MP3 / WAV;旧
music-2.5配置需重新选模,服务可用性取决于账号权限
服务商配置与稳定性
- Alibaba / Alibaba (China) 新增 Workspace ID 和 Region 配置,媒体接口按业务空间与地域构建,聊天继续使用原有 API Base;语音与 3D 模型列表按地域筛选
- 修复快速修改多个默认模型时相互覆盖的问题,按顺序保存并合并最新设置;保存失败回退到已确认值,过期读取结果不再覆盖新选择
- 模型选择器按当前值显示选中项,避免加载列表时触发多余保存,并阻止过期请求覆盖切换后的模型类型
- 修复直连及代理请求处理中对 multipart / 二进制上传内容的错误改写,仅对 JSON 请求执行内容转换,保留上传文件字节
文档与模型目录
- 同步中英文 README、服务商配置、基本使用、项目文件预览与工具说明,补齐媒体模型选择、业务空间/地域、输入限制和停止行为
- 更新模型目录快照:供应商由 217 个增至 218 个;按供应商与模型 ID 统计,模型条目由 7,591 个调整为 7,854 个,新增 379 个、移除 116 个,并更新已有条目的能力、限制等元数据