Ainexis
逐节拆解 MMLU 基准论文:57 个学科任务、四大门类的设…
当行业习惯用单一榜单分数给大模型排名时,斯坦福 CRFM 团…
逐条拆解 GPQA 这个「研究生级、搜不到答案」的评测基准:…
逐节拆解 DeepSeek-R1 技术报告:GRPO 组内相…
Chain-of-Thought(思维链)提示只用寥寥几个带…
逐条拆解 Tree of Thoughts 论文:思维链为什…
逐节拆解 RAG 原论文:参数记忆与非参数记忆的融合逻辑、R…
开放域问答一直靠 TF-IDF、BM25 这类关键词匹配做检…
逐条拆解 Self-RAG 论文:传统 RAG 为什么「该查…
逐节拆解 InstructGPT 论文:从 SFT 到奖励模…
教 AI 变安全,通常要人逐条标注「有害」样本,又贵又慢。C…
逐条拆解 DPO 论文:RLHF 为什么要分「训奖励模型 +…
逐节拆解 LoRA 论文:冻结预训练权重、注入低秩分解矩阵的…
GPT 类模型动辄上千亿参数,推理要好几张 GPU,普通人根…
逐条拆解 QLoRA 论文:LoRA 已经省了可训练参数,但…