Logic Density Pruning
Mitigating Overthinking via Step-Level Chain of Thought Compression
针对大语言模型在复杂问题上反复验证、消耗大量无效推理 token 的现象,提出逻辑密度剪枝(LDP)框架。方法结合互信息(MI)与注意力引用分数衡量步骤重要性,再用步级微扰检查(SPC)保护关键逻辑,最后通过 SFT/LoRA 训练压缩后的推理轨迹。研究同时回应两类痛点:模型缺乏难度感知,且生成阶段缺少可控的外部干预。
MY ROLE 在远程服务器中完成 Qwen3 与 DeepscaleR 多分支思维链生成、提取和清洗;使用 Python 批量计算基于希尔伯特-施密特独立性准则的互信息得分,统计“犹豫标记”与“结论标记”的词频分布;主导单一 MI、单一注意力指标的消融实验,并完成 TokenSkip、SBT 等基线的对比训练。DeepscaleR-1.5B 的 Token 消耗降低 49.2%,准确率由 40.8% 提升至 44.3%。
