* feat: add opt-in task notes and compacted history recall * fix: validate task continuity state and preserve user answers Honor explicit opt-out, preserve clarification replies and capture failure statuses, validate notebook writes, and clear branch archive references. Update the config version and audit optional LLM credentials, with regression and integration evidence. * fix: align Helm config version with task continuity schema * fix: preserve mixed task history and declare continuity policies * fix: recover malformed history and evict archives atomically
3.8 KiB
本轮结论与建议
先做可选的任务笔记与原文回查增强;这轮结果不支持默认引入向量检索,也不支持全面替换现有摘要。
公开 LongMemEval-S 预选 42 例,40 例得到完整四组结果。另两例 60d45044、60472f9c 在重复低负载恢复后仍出现接口断连,按运行失败保留。有效样本上的自动评分为:A 摘要 9/40(22.5%),B 加笔记 11/40(27.5%),C 加关键词回查 36/40(90.0%),D 加向量混合回查 34/40(85.0%)。下方另列以 42 例为分母的保守成功率。
向量的增量必须看 D−C:本轮 1 例新增正确、3 例新增错误,净 −5.0 个百分点;配对 bootstrap 95% 区间为 [−15.0, +5.0],精确 McNemar p=0.625。不能据此证明总体负收益,也没有证据表明应默认开启这套 Qwen3-Embedding-0.6B+等权 RRF 混合方案。其中一条 C 胜 D 的自动评分涉及前后矛盾答案;若严格地把 C 也算失败,净差值会变成 −2.5 个百分点。这只是判分敏感性说明,主表没有改分。
按用户要求放宽执行预算、继续原缓存轨迹后,24 个回顾式交接任务的结果为 17/24、18/24、24/24、24/24;12 个从开始就明确目标的任务为 11/12、12/12、12/12、12/12。两组执行测试中,向量都没有相对关键词带来额外成功。目标明确时摘要本身已通过 11/12,因此更合理的定位是补强:保住批准的新参数、失败经验和精确产物,缺信息时能回原文核对。
预算续跑只处理原先触及步数/累计上下文限制的轨迹。20 条轨迹中,7 条恢复验收成功,13 条因没有新历史证据却连续校验失败而停止。实际最多使用 10 次模型调用、76,068 个累计代理上下文 token,未触及新的 24 步/192,000 上限。已完成样本没有重新生成答案,原预算成绩和实际文件都保留。
建议做成什么
- 每个任务一份工作笔记:当前目标、明确约束、已验证结论、失败方案、待办和来源 ID。与跨会话用户画像分开。
- 保存原始工作记录:用户消息、助手消息、工具调用及输出;附件保存引用。提供关键词搜索和按记录 ID 读取原文,支持任务范围隔离。
- 保留摘要与近期消息:笔记负责当前工作状态,回查补回被压缩的细节。笔记写入或向量服务失败时,应能降级继续,避免新增依赖卡住主任务。
- 向量作为可插拔选项:本轮确有一例语义召回独有成功,也有排序挤掉关键事实的损失;待更贴近实际任务的数据证明稳定净收益后,再考虑默认开启。
组织方式可借鉴 Codex 实验配置中的任务笔记与历史接续思路,存档与检索工程可参考 OpenClaw session search。本轮测试的是独立的“摘要上加笔记/回查”原型,没有运行或比较完整 Codex、OpenClaw 产品。
结论的适用范围
这是小样本、强制多次压缩条件下的原型测试。公开历史摘要有 310/421 次触及生成上限;回顾式任务摘要为 72/72 次,已知目标对照为 9/36 次。这个压力设置会影响信息保留,不能把 A 的成绩称为生产 DeerFlow 默认性能。公开 QA 使用同一个 Qwen 模型作裁判,已发现证据标签缺口与判分边界;合成任务来自六类模板,变体具有相关性。没有运行 LongMemEval-V2 或 LoCoMo,也没有修改、集成或部署生产运行时。
下一步如果实施,应先做任务级原文回查与工作笔记,再用真实 DeerFlow 多轮工具任务验证压缩后的恢复、约束遵守和最终产物验收;本轮不支持宣传一个普遍的“生产成功率提升百分比”。