Wenchao An 1b76ab9060
feat: add opt-in task notes and compacted history recall (#5382)
* feat: add opt-in task notes and compacted history recall

* fix: validate task continuity state and preserve user answers

Honor explicit opt-out, preserve clarification replies and capture failure statuses, validate notebook writes, and clear branch archive references. Update the config version and audit optional LLM credentials, with regression and integration evidence.

* fix: align Helm config version with task continuity schema

* fix: preserve mixed task history and declare continuity policies

* fix: recover malformed history and evict archives atomically
2026-09-12 21:01:46 +08:00

27 lines
3.8 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

## 本轮结论与建议
**先做可选的任务笔记与原文回查增强;这轮结果不支持默认引入向量检索,也不支持全面替换现有摘要。**
公开 LongMemEval-S 预选 42 例40 例得到完整四组结果。另两例 `60d45044``60472f9c` 在重复低负载恢复后仍出现接口断连按运行失败保留。有效样本上的自动评分为A 摘要 **9/4022.5%**B 加笔记 **11/4027.5%**C 加关键词回查 **36/4090.0%**D 加向量混合回查 **34/4085.0%**。下方另列以 42 例为分母的保守成功率。
向量的增量必须看 DC本轮 **1 例新增正确、3 例新增错误,净 5.0 个百分点**;配对 bootstrap 95% 区间为 **[15.0, +5.0]**,精确 McNemar p=0.625。不能据此证明总体负收益,也没有证据表明应默认开启这套 Qwen3-Embedding-0.6B+等权 RRF 混合方案。其中一条 C 胜 D 的自动评分涉及前后矛盾答案;若严格地把 C 也算失败,净差值会变成 2.5 个百分点。这只是判分敏感性说明,主表没有改分。
按用户要求放宽执行预算、继续原缓存轨迹后24 个回顾式交接任务的结果为 **17/24、18/24、24/24、24/24**12 个从开始就明确目标的任务为 **11/12、12/12、12/12、12/12**。两组执行测试中,向量都没有相对关键词带来额外成功。目标明确时摘要本身已通过 11/12因此更合理的定位是补强保住批准的新参数、失败经验和精确产物缺信息时能回原文核对。
预算续跑只处理原先触及步数/累计上下文限制的轨迹。20 条轨迹中7 条恢复验收成功13 条因没有新历史证据却连续校验失败而停止。实际最多使用 10 次模型调用、76,068 个累计代理上下文 token未触及新的 24 步/192,000 上限。已完成样本没有重新生成答案,原预算成绩和实际文件都保留。
### 建议做成什么
1. **每个任务一份工作笔记**:当前目标、明确约束、已验证结论、失败方案、待办和来源 ID。与跨会话用户画像分开。
2. **保存原始工作记录**:用户消息、助手消息、工具调用及输出;附件保存引用。提供关键词搜索和按记录 ID 读取原文,支持任务范围隔离。
3. **保留摘要与近期消息**:笔记负责当前工作状态,回查补回被压缩的细节。笔记写入或向量服务失败时,应能降级继续,避免新增依赖卡住主任务。
4. **向量作为可插拔选项**:本轮确有一例语义召回独有成功,也有排序挤掉关键事实的损失;待更贴近实际任务的数据证明稳定净收益后,再考虑默认开启。
组织方式可借鉴 [Codex 实验配置中的任务笔记与历史接续思路](https://learn.chatgpt.com/docs/config-file/config-reference),存档与检索工程可参考 [OpenClaw session search](https://docs.openclaw.ai/concepts/session-search)。本轮测试的是独立的“摘要上加笔记/回查”原型,没有运行或比较完整 Codex、OpenClaw 产品。
### 结论的适用范围
这是小样本、强制多次压缩条件下的原型测试。公开历史摘要有 310/421 次触及生成上限;回顾式任务摘要为 72/72 次,已知目标对照为 9/36 次。这个压力设置会影响信息保留,不能把 A 的成绩称为生产 DeerFlow 默认性能。公开 QA 使用同一个 Qwen 模型作裁判,已发现证据标签缺口与判分边界;合成任务来自六类模板,变体具有相关性。没有运行 LongMemEval-V2 或 LoCoMo也没有修改、集成或部署生产运行时。
下一步如果实施,应先做任务级原文回查与工作笔记,再用真实 DeerFlow 多轮工具任务验证压缩后的恢复、约束遵守和最终产物验收;本轮不支持宣传一个普遍的“生产成功率提升百分比”。