本次更新围绕浏览器自动化、本地语音和项目记忆展开:将浏览器统一整合到聊天预览,支持多标签页与并发聊天操作;完善语音模型下载和离线加载,新增 Breeze TTS 2 与音频播放卡片;让项目时间线成为可检索、可复用的项目记忆,并优化后台 Agent 的结果展示。
What's Changed
聊天内置浏览器与多标签页
- 浏览器统一使用应用内置的 Electron Chromium,AgentBrowser 可直接在聊天预览中展示并操作网页,无需另外安装 Chrome 或 Edge。
- 每个聊天支持独立的多个标签页,提供地址栏、新建、切换、关闭、前进、后退和刷新;普通聊天与项目聊天均可使用。
- 不同聊天可并行执行浏览器操作,同一聊天的工具动作按顺序执行。Agent 的操作目标与用户正在查看的标签页分别维护,手动切换预览不会改变 Agent 的操作目标。
- 浏览器标签页共享 Cookie、登录状态和站点存储;WebFetch 的浏览器回退复用同一登录会话,通过临时页面读取内容,完成后自动关闭。
- 完善停止操作、关闭标签页和删除聊天时的资源清理。实例管理页可查看 Chromium 版本、标签页及聊天数量、打开浏览器数据目录,并关闭全部标签页。
本地语音模型与音频体验
- 在「设置 → 本地模型」中新增语音合成(TTS)和语音识别(STT)管理,支持 Qwen3 TTS、VoxCPM2、Breeze TTS 2、Qwen3 ASR 及其对齐模型;本机 API 与配套脚本同步支持语音模型的查询、下载和删除。
- 按平台提供 macOS 的 MLX 模型与 Windows / Linux 的 PyTorch 模型目录,并提供 Hugging Face、ModelScope 下载来源。Qwen3 ASR 下载时自动准备所需的 ForcedAligner。
- 语音推理改为从应用管理的模型目录加载已下载权重;下载状态同时检查权重分片、分词器、音频编解码器和依赖模型,缺失时给出提示。推理期间阻止删除语音模型,空闲删除前先释放运行时。
- 新增 Breeze TTS 2 接入,支持声音描述、参考音频克隆及结合参考音色的演绎指令,并保留模型支持的中英文发声事件。完善 Qwen3 TTS 按预设音色、声音设计和参考音频选择对应模型变体的逻辑。
- TextToSpeech 结果新增音频播放卡片和朗读文本,ListVoices 新增已保存参考音色的试听、文本及目录展示;音频缺失或无法播放时提供明确反馈。
- 新增内置
audiogen技能,按模型提供朗读、声音设计、克隆、发声事件与音乐生成的提示词指南,并说明如何复用本地参考音色。未配置语音模型或供应商不可用时,工具返回具体的设置指引。 - 限制长语音转写返回给模型的文本行数,保留首尾内容并标记截断;生成的 SRT / ASS 字幕文件仍保留完整内容。
项目记忆与时间线
- 项目时间线接入 Project Memory,以任务摘要标题保存独立条目,保留详细总结、产出及来源信息;旧时间线在迁移成功后移除旧表,失败时保留原数据以便重试。
- Memory 工具支持全局与项目两种范围。项目聊天默认使用当前项目记忆,普通聊天默认使用全局记忆;项目之间按范围隔离,支持检索、读写、删除及分页列举。
- 项目聊天在全局记忆摘要之后引入同项目其他聊天最新的 10 条时间线标题,按需通过 Memory 工具读取详情,帮助后续任务接续已有成果。
- 创建和编辑项目时可直接设置时间线开关,新项目默认开启。开启后,符合条件的任务会生成总结,这会额外消耗少量 Token。
- 改善记忆写入和索引更新,更新条目时保留稳定 ID,串行处理同条目的并发写入;删除项目或聊天时清理对应来源的项目记忆。
后台任务展示与工具改进
- 后台 Agent 完成通知改为结构化展示,可查看任务描述、成功/失败/终止状态、执行结果、错误信息及时间详情,并兼容可识别的历史通知格式。
- 修复子 Agent 请求上下文的传递;Vision 未单独配置视觉模型时,可回退使用当前聊天模型,实际图像处理能力取决于所选模型。
- 同步更新中英文 README、浏览器使用说明、本地语音指南与项目记忆文档。
模型目录更新
- 更新内置模型目录快照,供应商由 222 个增至 225 个,模型条目由 7,920 个调整为 7,938 个;按供应商与模型 ID 统计,新增 43 个、移除 25 个,并更新 72 个已有条目的元数据。
升级说明
- 浏览器数据迁移:新版将原内置浏览器数据迁入
<应用用户数据目录>/instances/default_browser,保留原内置浏览器的登录信息;该默认目录中的旧外部浏览器资料会被清理,旧 Chrome / Edge 实例的登录状态不会迁入。系统浏览器和此前指定的其他自定义目录不受影响。升级前请退出仍在使用旧默认目录的浏览器。 - 共享登录状态:聊天之间隔离标签页与操作,但共享账号登录状态;在一个聊天中退出登录或切换账号,会影响其他聊天。应用重启后登录数据保留,标签页需重新打开。
- 本地语音准备:先安装 QwenAudio 运行环境,再在本地模型设置中下载所需模型并选择默认语音模型。推理不再自动下载权重,旧 Hugging Face / ModelScope 缓存不会自动迁移或删除。
草稿范围说明:以上内容基于
v0.3.55之后dev分支的已提交更新(00512b1),以及当前本地 0.3.56 的未提交改动整理。草稿目标仍为main,目前尚未包含这些更新;正式发布前需合入代码、核对最终提交与安装包,并据此更新发布说明。本次仅核对源码并编辑发布描述,未执行应用构建、安装包或真实浏览器/语音推理验收。
已提交变更对比:v0.3.55...00512b1(不含上述本地未提交改动)