Ainexis
逐节拆解 DeepSeek-R1 技术报告:GRPO 组内相…
逐节拆解 InstructGPT 论文:从 SFT 到奖励模…
逐节拆解 RAG 原论文:参数记忆与非参数记忆的融合逻辑、R…
逐节拆解 MMLU 基准论文:57 个学科任务、四大门类的设…
逐节拆解 LoRA 论文:冻结预训练权重、注入低秩分解矩阵的…
逐条拆解 Tree of Thoughts 论文:思维链为什…
逐条拆解 Self-RAG 论文:传统 RAG 为什么「该查…
逐条拆解 GPQA 这个「研究生级、搜不到答案」的评测基准:…
逐条拆解 DPO 论文:RLHF 为什么要分「训奖励模型 +…
逐条拆解 QLoRA 论文:LoRA 已经省了可训练参数,但…