ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

为什么AI也要算命考试?MingLi-Bench八字命理评测基准深度解析

为什么AI也要算命考试?MingLi-Bench八字命理评测基准深度解析 为什么AI也要算命考试MingLi-Bench八字命理评测基准深度解析【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-BenchMingLi-Bench 是一个面向大语言模型的中国传统命理评测基准用 160 道来自真实赛事的八字与紫微斗数选择题来考试 AI 的推理能力和传统文化理解力。当数学和代码榜单卷不动时一批开发者把目光投向了更硬核的领域——让 AI 算命。听起来很玄学但背后的评测设计其实非常工程化。MingLi-Bench 正是这样一个开源评测框架它给各家大模型GPT、Claude、Gemini、DeepSeek、豆包等出了一份命理考卷看看谁才是那个真正懂命的 AI。一、为什么用算命来考 AI大多数 AI 评测考的是代码、数学、常识而命理推理是另一类难题它同时考验模型的三件事长链条推理从出生时间排盘到五行生克、星曜宫位再到流年推断一步错则步步错传统文化知识八字、紫微斗数属于高度专业化的中文知识体系模型训练语料中占比有限⚖️不确定性下的判断题目常给出多个看似都说得通的选项很像现实中的开放性推理。所以AI 算命考试不是猎奇而是给大模型出了一套中文文化 复杂推理的复合考题。二、题库揭秘160 道真题覆盖 12 种人生维度MingLi-Bench 的题目并非凭空编造而是整理自全球算命师大赛 2022–2025 年度赛题每年 40 题、共 160 题均为四选一选择题并配有标准答案精确匹配评分规则简单透明。题目覆盖 12 大人生类别和人们最关心的现实问题一一对应类别示例问题事业 / 财运某年合作生意赚了还是赔了婚姻 / 子女此命何年结婚健康 / 灾劫某年发生何事疾病、意外等官非 / 家庭 / 性格 / 学业 / 外貌 / 运势……题库的核心文件都放在 data/ 目录下data/data.json160 道规范化选择题含生辰信息、问题、选项与标准答案data/fortune_api_results.json预先排好的八字 紫微斗数命盘按case_id与题目关联data/raw/2022–2025 四年赛事原始题卷如 data/raw/2025.txt方便溯源核对。三、评测流程如何判断 AI 算得准不准整个评测由 mingli_bench/benchmark.py 中的FortuneTellingBenchmark类驱动流程非常直观读题mingli_bench/data/loader.py 按年份、类别加载题目组卷把生辰信息与题目拼成提示词例如命主信息男命1974年4月28日……此命 1996 年发生何事A/B/C/D答题通过 mingli_bench/models/factory.py 创建的模型客户端并发调用大模型默认 5 路并发判分从回答中提取答案X与标准答案精确匹配统计总正确率和分类别正确率落盘把每题的预测、原始回答、耗时都写进结果文件方便复盘。其中有两个开关值得新手特别注意--cot思维链要求模型先展示推理过程再给答案通常能显著提升得分——这本身就是一次有价值的消融实验--astro注入命盘直接把预先排好的八字 / 紫微斗数命盘塞进提示词让模型只做推理、不做排盘。这样分数反映的是推理能力而不是农历换算能力评测更公平。四、快速上手三步让 AI 参加命理考试第一步获取项目git clone https://gitcode.com/gh_mirrors/mi/MingLi-Bench cd MingLi-Bench pip install -r requirements.txt依赖非常轻量见 requirements.txt。第二步配置 API Key复制.env.example为.env只需填写你实际要测的服务商密钥OpenAI、Anthropic、Google、DeepSeek、豆包或通过 OpenRouter 一个密钥调多家。模型路由由 mingli_bench/models/ 下的客户端实现mingli_bench/models/openai_client.pymingli_bench/models/anthropic_client.pymingli_bench/models/deepseek_client.pymingli_bench/models/doubao_client.py可以先做个连通性自检python -m mingli_bench.cli --list-models # 查看支持的模型 python -m mingli_bench.cli --stats # 查看数据集统计第三步开考python -m mingli_bench.cli --model openai/gpt-4o --year 2025 --cot --astro常用参数速查完整说明见 mingli_bench/cli.py参数作用--model模型名含/时自动走 OpenRouter--year只考某一年可选 2022–2025--cot/--astro开启思维链 / 注入预排命盘推荐同时开启--categories只考指定类别如--categories 事业 婚姻--shuffle-options打乱选项顺序防位置偏差--sample N只跑前 N 题快速冒烟测试五、结果怎么读每轮评测在logs/下生成三类产物产物内容model_results.json每题的预测答案、是否正确、分类别统计model_summary.txt总正确率、分类别正确率、平均响应时间model_responses/每题的完整提示词与模型原始回答便于人工复核重点看两个指标Overall Accuracy总正确率和分类别正确率——你会发现同一模型在婚姻上可能很灵在灾劫上却一败涂地这种细粒度画像正是基准的价值所在。六、常见问题FAQQ1这个基准是在评测算命准不准吗不是。它评测的是 AI 在给定专业文化知识后做多步推理的能力。命盘是确定的、答案有标准考的是从命盘到事件的推理链而非现实预测能力。Q2为什么推荐同时开--cot和--astro--astro隔离了排盘这一纯计算环节--cot给模型留出推演空间两者结合后分数最能反映纯粹的推理水平关掉它们则可以做消融对比。Q3能接入其他模型吗可以。mingli_bench/models/factory.py 中的ModelFactory.register_provider支持注册新服务商只需提供一个ModelClient子类。写在最后MingLi-Bench 用最接地气的题材做了一件很学术的事把模糊的传统文化知识转化为可复现、可对比、可复盘的量化评测。如果你关心大模型的中文文化理解与复杂推理这份AI 算命考卷值得一试。核心资料索引题库数据data/data.json 预排命盘data/fortune_api_results.json评测引擎mingli_bench/benchmark.py 命令行入口mingli_bench/cli.py中文文档README_zh.md【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表