- [Official Claude 5.5 Metadata Injection & 128k Pipeline Ceiling Lift] Inject Full Claude 5.5 Live Traffic Metadata, Dynamic Inbound Pipeline & Cross-Protocol 128k Limit:
- Authoritative Claude 5.5 Metadata Populated: Captured live traffic from Antigravity Hub to populate
official_models.jsonwith all 6 Claude 5.5 models (claude-sonnet-5-5-low/medium/high,claude-opus-5-5-low/medium/high), including internal IDs (MODEL_PLACEHOLDER_M400~M405), 1M context, 128k output limit,thinkingLevel1/2/3, andvertexModelId— establishing a verified catalog baseline for tier routing. - Pipeline Inbound Ingress 128k Ceiling Lifted: Replaced legacy 64k static truncation in
InboundThinkingPipelinewith catalog-driven resolution, granting Claude 5.5 models up to 128,000 output tokens to prevent long reasoning answers from being truncated at ingress. - OpenAI & Claude Protocol Adapter Limit Relaxed: Relaxed
safe_limitguards in both OpenAI-compat (openai/request.rs) and Anthropic Claude (claude/request.rs) layers to allow client requests up to 128,000 output tokens without protocol-layer capping.
- Authoritative Claude 5.5 Metadata Populated: Captured live traffic from Antigravity Hub to populate
- [Dynamic Capability Detection, Model-Scoped Circuit Breaker & Auto-Rotation] Quota-Driven Pool Convergence, 404 Evasion & Conversation Continuity:
- Dynamic Capability Detection & Quota-Refresh Candidate Convergence: Introduced
token_supports_advanced_modelinTokenManager. Schedulers inspect models dynamically returned from periodic (or manual) quota refreshes, automatically routing advanced model traffic strictly to qualified accounts with top priority while keeping graceful fallbacks for cold starts. - Unentitled PRO Account 404/403 Model-Scoped Circuit Break & Rotation Loop: Implemented
mark_model_unsupportedacross handlers (claude.rs,openai.rs,gemini.rs) andTokenManager. When unentitled accounts hit 404/403 on unrolled Claude 5.5 models, the specific model is temporarily isolated (900s) without penalizing other functional models (e.g. Claude 4.6 / Gemini 3), seamlessly rotating to other ready candidates and eliminating client-side 404 errors. - Non-Streaming Collection Interruption Retry Closure (Fixes #3593): Fixed a bug in
collect_stream_to_jsonwhere upstream connection drops during deep thinking silence caused immediate HTTP 500 errors; now setsforce_rotate = trueand triggers automated rotation retry. - Official Catalog & Dynamic Capability Regression Tests: Added
OfficialModelCatalogresolution assertions for Claude 5.5 authoritative metadata alongsidetest_claude_5_5_dynamic_capability_filtering_and_priorityverifying capability filtering, single-model evasion, and priority sorting.
- Dynamic Capability Detection & Quota-Refresh Candidate Convergence: Introduced
- [官方 Claude 5.5 实机元数据注入与全链路 128k 解禁] 对接官方 Antigravity Hub 最新抓包流量,打通 Inbound 进站终审与各协议层 128k 动态上限:
- 官方 Claude 5.5 真实模型元数据全量入库: 依据官方实机流量首次为
official_models.json注入全部 6 款 Claude 5.5(claude-sonnet-5-5-low/medium/high与claude-opus-5-5-low/medium/high)权威内部代号(MODEL_PLACEHOLDER_M400~M405)、1M 上下文上限、128k 输出上限、thinkingLevel1/2/3 档位与vertexModelId,为分档路由器提供真实的官方数据基准。 - Pipeline 进站终审 128k 限制解禁:
InboundThinkingPipeline终审上限保护由旧版静态截断(64k)升级为优先遵循官方目录权威设定,并为 Claude 5.5 放宽至 128,000 输出 Token,彻底解决超长生成被网关终审截断的问题。 - OpenAI 与 Claude 协议转译层上限放宽: 在
openai/request.rs与claude/request.rs的safe_limit逻辑中对齐 Claude 5.5,支持客户端合法请求最高 128,000 输出 Token 不被协议层裁剪。
- 官方 Claude 5.5 真实模型元数据全量入库: 依据官方实机流量首次为
- [高级模型动态能力探测、未开通账号单模型熔断与重试闭环] 联动配额自动收敛优质号池,隔离 404 账号并保障对话连续性:
- 联动配额刷新的动态能力探测与号池收敛: 在
TokenManager引入token_supports_advanced_model探测机制。依据后台定时额度刷新(或手动刷新)拉取的实时模型配额,自动将高级模型请求精准导流至已开通该能力的账号,并赋予最高调度优先级;同时针对冷启动与离线状态提供平滑降级兜底。 - 未获权限 PRO 账号 404/403 单模型临时熔断与换号重试: 在协议层与
TokenManager落地mark_model_unsupported。当未灰度到 Claude 5.5 的 PRO 账号报错 404/403 时,仅对该账号隔离特定模型(900s 临时避让),绝不连坐该账号调用其他正常模型(如 Claude 4.6 / Gemini 3),并在账号池有富余候选时自动换号重试,彻底消灭客户端 404 报错。 - 非流式转流收集断流换号重试闭环 (Fixes #3593): 修复
collect_stream_to_json非流式转流收集阶段在深度思考静默期发生底层断流时直接抛 500 的缺陷,设置force_rotate = true并触发自动换号重试。 - 官方目录与动态能力回归测试: 补齐
OfficialModelCatalog对 Claude 5.5 真实元数据的解析断言,以及TokenManager动态能力过滤、单模型熔断避让与优先级断言测试。
- 联动配额刷新的动态能力探测与号池收敛: 在
Full Changelog: v4.9.2-beta.6...v4.9.2-beta.7