### 使用场景 / 要解决的问题 当前工具调用大模型时,当输入总token超过模型最大上下文限制,直接返回HTTP 400报错。 工具没有内置上下文压缩,对话历史累积后请求直接失败,无法自动恢复。 ### 期望的解决方案 希望新增功能: 1. 上下文摘要压缩:把久远对话浓缩为简短摘要,降低token占用。 2. 发送前预估总token数量展示。 3. 软阈值触发:在达到模型硬上限之前就自动压缩,防止超限报错。 ### 备选方案 _No response_ ### 补充信息 _No response_
使用场景 / 要解决的问题
当前工具调用大模型时,当输入总token超过模型最大上下文限制,直接返回HTTP 400报错。
工具没有内置上下文压缩,对话历史累积后请求直接失败,无法自动恢复。
期望的解决方案
希望新增功能:
1. 上下文摘要压缩:把久远对话浓缩为简短摘要,降低token占用。
2. 发送前预估总token数量展示。
3. 软阈值触发:在达到模型硬上限之前就自动压缩,防止超限报错。
备选方案
No response
补充信息
No response