通过强化学习后训练,提高 Qwen 系列模型在工业异常检测任务中的识别与推理能力。
围绕训练方法与论文数据两部分参与研究。
使用 VERL 框架组织后训练流程。
使用 DAPO 方法对 Qwen 系列模型进行训练。
目标是提升模型的识别准确性与推理能力。
参与相关论文的数据采集和生成工作。
相关工作已投递 NeurIPS 2026。