
模型评测人工智能大模型AI 评测【免费下载链接】opencompassOpenCompass is an LLM evaluation platform, supporting a wide range of models from OpenAI, Anthropic, Gemini, Qwen, GLM, DeepSeek, etc, across 100 datasets covering knowledge, reasoning, coding, science, language, long-context, and safety.项目地址https://gitcode.com/gh_mirrors/op/opencompass点击查看免费下载ARC Prize 以开源方式推动 AGI 研究进展其公共评测集 ARC-AGI Public Evaluation 要求模型仅凭少量输入输出示例归纳隐含规则并还原测试网格是衡量抽象推理能力的高难度基准。本文以 opencompass/configs/datasets/ARC_Prize_Public_Evaluation/README.md 为核心结合仓库中的数据集实现与评测配置完整讲解任务 JSON 格式、OpenCompass 中的生成式评测配置、提示词模板以及像素级比对评分原理读者可按文直接复现 ARC-AGI 1 与 ARC-AGI 2 两套公共评测。ARC Prize 与公共评测集定位ARC Prize 的目标是推动通往 AGI 的开源进展参赛者若想赢得奖金必须将可复现的代码/方法发布到公共领域。ARC Prize 官方使用 ARC-AGI 私有评测集 度量 AGI 进展排行榜发布在 arcprize.org而大奖Grand Prize将在首个团队达到至少 85% 正确率时解锁。私有评测集对解决方案施加了限制例如不允许访问互联网因此无法使用 GPT-4/Claude 等在线模型。与此同时存在一个名为 ARC-AGI-Pub 的二级排行榜它基于公共评测集public evaluation set进行度量不施加上述限制但截至 README 编写时并不属于 ARC Prize 2024 的正式组成部分。在 OpenCompass 仓库中对应数据集在 dataset-index.yml 中被登记为arc_prize_public_eval分类为ARC-AGI其默认配置路径即opencompass/configs/datasets/ARC_Prize_Public_Evaluation/arc_prize_public_evaluation_gen.py。该目录下共提供 4 份生成式评测配置覆盖 ARC-AGI 1 与 ARC-AGI 2 两代任务集配置文件版本说明arc_prize_public_evaluation_gen.pyarc_agi_1通过read_base复用_872059变体的数据集定义arc_prize_public_evaluation_gen_872059.pyarc_agi_1完整配置GenInferencer(max_out_len2048)arc_prize_public_evaluation_gen_fedd04.pyarc_agi_1完整配置与 872059 高度一致arc_agi_2_public_evaluation_gen.pyarc_agi_2ARC-AGI 2 公共评测支持n2, k2采样与投票任务格式JSON 中的训练对与测试对ARC-AGI 任务是一系列三到五个输入输出任务对 最后一个只给出输入的任务。每个任务检验基于极少量认知先验cognitive priors的某种特定习得技能。任务在 JSON 中表示为整数组成的列表也可借助 ARC-AGI 任务查看器将 JSON 对象可视化为彩色网格。一次成功的提交是指对最终任务的输出给出颜色与位置都逐像素正确的描述。每个任务 JSON 文件包含两个键值对train由 2 到 10 个输入/输出对组成通常为 3 个供算法推断规则使用test由 1 到 3 个输入/输出对组成通常为 1 个。模型应基于train集推断出的规则构造输出解。公共数据中可以看到测试输出参考答案私有评测集中的测试输出则不会公开。README 给出了一个简单示例任务包含三个训练对与一个测试对每对均以 2x2 网格呈现用整数 1、4、6、8 表示四种颜色每个整数实际对应红/绿/蓝/黑中的哪种颜色是任意的{ train: [ {input: [[1, 0], [0, 0]], output: [[1, 1], [1, 1]]}, {input: [[0, 0], [4, 0]], output: [[4, 4], [4, 4]]}, {input: [[0, 0], [6, 0]], output: [[6, 6], [6, 6]]} ], test: [ {input: [[0, 0], [0, 8]], output: [[8, 8], [8, 8]]} ] }该任务隐含的规则是将网格中的非零颜色扩散填充为整行/整列。模型需要从三个训练对归纳出这一规律再应用到测试输入[[0, 0], [0, 8]]上得到[[8, 8], [8, 8]]。数据集加载实现按版本白名单筛选任务在 opencompass/datasets/arc_prize_public_evaluation.py 中ARCPrizeDataset注册为LOAD_DATASET模块其静态方法load(path, version)会读取本地数据目录中的全部 JSON 文件并依据task_file_names白名单按版本arc_agi_1/arc_agi_2筛选任务arc_agi_1版本白名单包含数百个任务文件如2072aba6.json、bb52a14b.json等arc_agi_2版本白名单包含 128 个任务文件如136b0064.json、898e7135.json等部分文件名与 v1 重叠但内容不同。每个任务被转换成语料行task { training_data: task[train], input_test_data: task[test][0][input], output_test_data: task[test][0][output] }最终通过Dataset.from_list(dataset)构造 HuggingFacedatasets.Dataset供下游 reader 使用。从数据获取看opencompass/utils/datasets_info.py 将opencompass/arc_prize_public_evaluation与opencompass/arc_agi_2_public_evaluation均映射到本地目录./data/arc_prize_public_evaluation并提供远程下载地址OpenCompass OSS 上的arc_prize_public_evaluation.zip。load内部通过get_data_path(path)解析本地数据根目录再结合os.listdir遍历任务文件。生成式评测配置逐项拆解以 arc_prize_public_evaluation_gen_872059.py 为例配置由 reader、infer、eval 三段组成提示词模板系统提示与用户消息system_prompt You are a puzzle solving wizard. You are given a puzzle from the abstraction and reasoning corpus developed by Francois Chollet. user_message_template Here are the example input and output pairs from which you should learn the underlying rule to later predict the output for the given test input: ---------------------------------------- {training_data} ---------------------------------------- Now, solve the following puzzle based on its input grid by applying the rules you have learned from the training data.: ---------------------------------------- [{{input: {input_test_data}, output: [[]]}}] ---------------------------------------- What is the output grid? Only provide the output grid in the form as in the example input and output pairs. Do not provide any additional information:系统提示将模型定位为谜题求解大师用户模板将training_data训练对与input_test_data测试输入嵌入提示并明确要求只输出输出网格、不附带任何额外信息——这是为了配合后续基于[[提取答案的解析逻辑。注意{{input: ...}}中的双花括号用于在模板渲染时保留字面量花括号。reader / infer / eval 三段配置arc_prize_public_evaluation_reader_cfg dict( input_columns[training_data, input_test_data], output_columnoutput_test_data ) arc_prize_public_evaluation_infer_cfg dict( prompt_templatedict( typePromptTemplate, templatedict( round[ dict(roleSYSTEM, promptsystem_prompt), dict(roleHUMAN, promptuser_message_template), ], ) ), retrieverdict(typeZeroRetriever), inferencerdict(typeGenInferencer, max_out_len2048) ) arc_prize_public_evaluation_eval_cfg dict( evaluatordict(typeARCPrizeEvaluator) )reader_cfg以training_data、input_test_data作为输入列output_test_data作为输出列即喂入训练对 测试输入期望生成测试输出infer_cfg提示模板使用 PromptTemplate检索器使用ZeroRetriever不检索、直接使用完整上下文推理器使用GenInferencer并以max_out_len2048留足长网格输出的空间ARC-AGI 2 配置中未显式指定该参数使用默认值eval_cfg评测器为仓库自定义的ARCPrizeEvaluator。fedd04变体与872059基本一致仅将 SYSTEM 消息补充了fallback_roleHUMAN以兼容不支持 SYSTEM 角色的模型通道。而 arc_agi_2_public_evaluation_gen.py 中的 ARC-AGI 2 配置在数据集字典上额外设置了n2、k2即每个任务进行 2 次采样、以 2 个候选答案进行投票/汇总用于缓解生成式模型在该任务上的随机性。数据集字典arc_prize_public_evaluation_datasets [ dict( abbrARC_Prize_Public_Evaluation, typeARCPrizeDataset, versionarc_agi_1, pathopencompass/arc_prize_public_evaluation, reader_cfgarc_prize_public_evaluation_reader_cfg, infer_cfgarc_prize_public_evaluation_infer_cfg, eval_cfgarc_prize_public_evaluation_eval_cfg ) ]字段含义abbr为排行榜/日志缩写type指向注册的ARCPrizeDatasetversion决定任务白名单path指向数据源标识由get_data_path解析到本地./data/arc_prize_public_evaluation。ARC-AGI 2 配置对应abbrARC_AGI_2_Public_Evaluation、versionarc_agi_2、pathopencompass/arc_agi_2_public_evaluation。评测器从自由文本到像素级精度ARCPrizeEvaluator是评测的核心。其score方法对每条预测依次执行答案抽取 → 填充对齐 → 像素比对def score(self, predictions, references): accuracy [] details [] for pred, refer in zip(map(extract_solution, predictions), references): is_correct, correct_percentage compare_solutions_with_padding( pred, refer, pad_value-1) details.append({ correct: 1 if is_correct else 0, correct_percentage: correct_percentage, generated_solution: pred }) accuracy.append(1 if is_correct else 0) return {accuracy: np.mean(accuracy), details: details}三个关键机制答案抽取extract_solution在模型自由文本中定位第一个[[到其后的]]用ast.literal_eval安全解析为 Python 表达式并校验是整数组成的嵌套列表。若解析失败或结构不符则回退为[[0]]视为错误答案。这正是提示词要求只输出输出网格的原因——保证抽取结果可靠。填充对齐pad_array_with_valueARC 任务输出网格大小不固定模型可能给出不同行列数。比较前先将生成解与参考答案填充到统一形状(max_rows, max_cols)填充值-1标记不存在像素。像素级比对compare_solutions_with_padding只统计两个网格都非填充位的像素计算correct_percentage 正确像素数 / 总像素数 * 100且只有当全部像素都正确correct_pixels total_pixels时才判定该任务为正确is_correct。最终指标为逐任务正确率的均值accuracy。details中同时记录correct、correct_percentage与generated_solution便于在 OpenCompass 结果目录中排查失败案例例如模型输出的网格行列偏移、颜色数字错误等。运行方式与数据准备运行该评测需先在本地准备数据数据将被下载/解压到./data/arc_prize_public_evaluation映射关系见 opencompass/utils/datasets_info.py然后以配置文件启动 OpenCompasspython run.py \ opencompass/configs/datasets/ARC_Prize_Public_Evaluation/arc_prize_public_evaluation_gen.py \ -m hf # 以 HuggingFace 本地模型为例也可替换为 lmdeploy / vllm / api 等模型源若希望评测 ARC-AGI 2 公共集将配置替换为arc_agi_2_public_evaluation_gen.py即可。由于该任务对模型抽象归纳能力要求极高建议配合具备强推理能力的大模型运行并关注max_out_len是否足以容纳目标网格输出。基准表现参考README 给出了三个主流模型在该公共评测集上的准确率参考值可见当前通用指令模型在该任务上的得分极低任务难度显著Qwen2.5-72B-InstructLLaMA3.1-70B-Instructgemma-2-27b-it0.090.060.05这一量级的分数直观说明ARC-AGI 公共评测集衡量的是从极少样例中归纳抽象规则的能力而非知识记忆或语言生成能力任何模型要拿到高分都需要在提示工程如更细化的分步推理模板、多候选采样如 ARC-AGI 2 配置中的n2, k2或结合专用求解算法上做额外工作。OpenCompass 提供的这份配置即为研究者搭建通用 LLM 求解 ARC 任务基线提供了可直接复用的起点其details输出也能支撑后续针对失败任务的系统分析。赞分享模型评测人工智能大模型AI 评测【免费下载链接】opencompassOpenCompass is an LLM evaluation platform, supporting a wide range of models from OpenAI, Anthropic, Gemini, Qwen, GLM, DeepSeek, etc, across 100 datasets covering knowledge, reasoning, coding, science, language, long-context, and safety.项目地址https://gitcode.com/gh_mirrors/op/opencompass点击查看免费下载相关推荐LinkSwift 网盘直链解析免客户端3 分钟拿到九大网盘下载地址LinkSwift 网盘直链解析免客户端3 分钟拿到九大网盘下载地址 想从网盘下文件官方入口却逼你装客户端装完也只能单线程慢慢等LinkSwift网前端lm-evaluation-harness 中 AIME 数学竞赛评测任务的配置解析与答案校验实现lm evaluation harness 中 AIME 数学竞赛评测任务的配置解析与答案校验实现 导读 本文围绕 lm_eval/tasks/aime/REA人工智能模型评测AI 评测突破性ARC-AGI抽象推理任务的分类学与难度分级突破性ARC AGI抽象推理任务的分类学与难度分级 ARC AGI抽象和推理语料库作为人工智能领域的重要基准正在重新定义机器抽象推理能力的评估标准。本文数据集模型评测人工智能排行榜上一篇uni-app x 原生SDK iOS接入指南UniAppXSDK API 初始化、页面跳转、生命周期与通信实战下一篇2025抢票不再难py12306多任务并发抢票实战指南创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考