ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

一个密钥评测所有大模型?MingLi-Bench OpenRouter与原生接口双模式解析

一个密钥评测所有大模型?MingLi-Bench OpenRouter与原生接口双模式解析 一个密钥评测所有大模型MingLi-Bench OpenRouter与原生接口双模式解析【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-BenchMingLi-Bench是一个面向大语言模型LLM的中国传统命理评测基准覆盖八字与紫微斗数两大类题型全部采用选择题并以标准答案精确匹配计分。它最贴心的设计是双模式调用通过 OpenRouter 一个密钥即可评测市面上绝大多数主流模型也可以走各家原生接口直连调用。本文将完整解析这两种模式的使用方式与适用场景。 项目概览评测什么MingLi-Bench 的题库来源于2022–2025 年全球算命师大赛年度赛题共160 道标准化选择题覆盖事业、健康、婚姻、子女、财运等12 大类人生事件。数据文件说明data/data.json160 道选择题按十二类事件划分data/fortune_api_results.json预排好的八字 / 紫微斗数命盘与题目通过case_id关联data/raw/各年度原始赛题2022–2025 评测理念通过--astro注入预排命盘把「排盘」与「推理」两个环节解耦让分数真正反映模型的命理推理能力而不是排盘转换能力。 快速安装三步跑通 LLM 命理评测git clone https://gitcode.com/gh_mirrors/mi/MingLi-Bench cd MingLi-Bench pip install -r requirements.txt配置密钥只需复制模板按需填写即可空值会被自动忽略cp .env.example .env密钥与默认参数从.env读取加载逻辑见 mingli_bench/utils/config.py# OpenRouter —— 一个密钥覆盖大多数模型 OPENROUTER_API_KEYsk-or-... # 原生接口直接调用对应服务时才需填写 OPENAI_API_KEYsk-... ANTHROPIC_API_KEYsk-ant-... DEEPSEEK_API_KEYsk-... 模式一OpenRouter 单密钥评测所有模型这是日常使用最省心的模式。模型名写成provider/model形式带/CLI 会自动识别并路由到 OpenRouter无需任何额外参数python -m mingli_bench.cli --model openai/gpt-4o --year 2025 --cot --astro --max-workers 8 python -m mingli_bench.cli --model anthropic/claude-sonnet-4-6 --year 2025 --cot --astro python -m mingli_bench.cli --model deepseek/deepseek-r1 --year 2025 --cot --astro自动检测规则实现在 mingli_bench/models/factory.py 的get_provider方法中只要模型名含/就统一走 OpenRouter 通道。这意味着评测横评多个厂商的模型时你只需要维护一把密钥。 模式二原生接口直连--platform当模型名无法被自动识别例如带版本号的豆包 endpoint id或你想强制走某个 OpenAI 兼容网关时显式传入--platform即可# 原生豆包 / 火山引擎接口 python -m mingli_bench.cli \ --platform doubao --model doubao-seed-2-0-pro-260215 \ --year 2025 --cot --astro --max-workers 8--platform支持 6 种取值openai、openrouter、anthropic、google、deepseek、doubao。各厂商客户端位于 mingli_bench/models/ 目录按厂商懒加载只安装你实际用到的 SDK 即可。⚙️ 推荐参数--cot与--astro别忘开官方建议始终携带这两个开关--cot加入思维链指令让模型有空间逐步推演命盘--astro注入预排命盘剥离排盘误差对推理分数的干扰。其他实用开关完整说明见 mingli_bench/cli.py参数作用--year 2025只评测指定年份题目2022–2025--sample 10只跑前 10 题适合连通性冒烟测试--categories 事业 婚姻按类别筛选题目--max-workers 8并发数触发限流时调低--stats查看数据集统计不发起请求 评测结果怎么看每次运行在logs/目录生成三类产物model_results.json每题预测、打分与整体统计model_summary.txt核心指标摘要准确率model_responses/模型原始响应每题一个独立文件便于人工复核推理过程。✅ 总结双模式怎么选场景推荐模式横评多家主流模型OpenRouterprovider/model写法调用带版本号的专有模型原生接口 --platform走自建 OpenAI 兼容网关--platform openaiOPENAI_BASE_URLMingLi-Bench 用一个简洁的 CLI 把「命理评测」这件专业事变得和跑普通 benchmark 一样简单。无论你是想验证模型推理能力还是做命理 Agent 的消融实验这套双模式调用体系都能帮你在几分钟内开始评测。【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表