Reconciling Contradictory Views on the Effectiveness of SFT in LLMs: An Interaction Perspective
用 AND-OR 交互框架追踪 SFT 过程中推理模式的涌现与消亡,发现 SFT 主要去噪而非学习新模式,且有效阶段极短。
强化学习算法梳理:从 PPO 到 GRPO 及之后
梳理 2024-2026 年推理 LLM 强化学习的主要进展,从 REINFORCE、PPO 讲起,到 GRPO 及 DAPO、CISPO、GSPO 等后续改进方法。
Sublime Text
文章介绍了Sublime Text的破解步骤,并详细列举了其丰富的快捷键分类与用法,涵盖选择、编辑、搜索及显示等操作。
© 2026 xwysyy. All Rights Reserved.