跳过内容
退货商店
Ainexis
AI大模型
模型知识
开源模型
Agent工具
模型平台
部署教程
数据集
预训练语料
指令数据
偏好数据
评测基准
多模态
领域数据
专业论文
评测基准
推理增强
检索增强
对齐安全
模型压缩
微观视角
观点洞见
技术速递
深度解读
实战经验
在线工具
iPhone资讯
AI大模型
模型知识
开源模型
Agent工具
模型平台
部署教程
数据集
预训练语料
指令数据
偏好数据
评测基准
多模态
领域数据
专业论文
评测基准
推理增强
检索增强
对齐安全
模型压缩
微观视角
观点洞见
技术速递
深度解读
实战经验
在线工具
iPhone资讯
Ainexis
Ainexis
主页
大模型评测
标签:
大模型评测
评测基准
MMLU 论文精读:57 个学科任务如何定义了大模型的「知识广度」考卷
逐节拆解 MMLU 基准论文:57 个学科任务、四大门类的设…
2026-08-29
0
评测基准
448 道让博士只答对 65% 的题,究竟在考大模型什么?
逐条拆解 GPQA 这个「研究生级、搜不到答案」的评测基准:…
2026-07-01
0
关
首选项
更新
返回商店
主要菜单
AI大模型
模型知识
开源模型
Agent工具
模型平台
部署教程
数据集
预训练语料
指令数据
偏好数据
评测基准
多模态
领域数据
专业论文
评测基准
推理增强
检索增强
对齐安全
模型压缩
微观视角
观点洞见
技术速递
深度解读
实战经验
在线工具
iPhone资讯