INDUSTRIAL REASONING

大模型
后训练

通过强化学习后训练,提高 Qwen 系列模型在工业异常检测任务中的识别与推理能力。

VERLDAPOQWENDATA
DATA → REASONING → DETECTION

把通用模型能力,
对齐工业检测任务。

围绕训练方法与论文数据两部分参与研究。

FRAMEWORK

VERL

使用 VERL 框架组织后训练流程。

ALGORITHM

DAPO

使用 DAPO 方法对 Qwen 系列模型进行训练。

TASK

工业异常检测

目标是提升模型的识别准确性与推理能力。

DATA

数据采集与生成

参与相关论文的数据采集和生成工作。

STATUS

相关工作已投递 NeurIPS 2026。