Ainexis
教 AI 变安全,通常要人逐条标注「有害」样本,又贵又慢。C…
逐节拆解 InstructGPT 论文:从 SFT 到奖励模…
逐条拆解 DPO 论文:RLHF 为什么要分「训奖励模型 +…