ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

MingLi-Bench是什么?用大模型评测八字与紫微斗数算命的完整指南

2026/10/4 3:30:12 拓冰建站 浏览量
MingLi-Bench是什么?用大模型评测八字与紫微斗数算命的完整指南 MingLi-Bench是什么用大模型评测八字与紫微斗数算命的完整指南【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-BenchMingLi-Bench中国传统命理评测基准是一个专为大语言模型LLM打造的开源评测工具核心任务是用一套真实、可客观判分的选择题量化测试 AI 在八字与紫微斗数上的算命水平。简单说给它一个生辰和四选一的问题它替你调用各家大模型、自动判分并输出准确率报告。无论你是想验证某款 AI 的推理能力还是研究中国传统命理在智能时代的落地潜力这套命理大模型评测基准都能让你用最快速度上手。下面这篇指南帮你从零跑通第一次评测。一、为什么需要八字 / 紫微斗数的大模型评测中国传统命理八字四柱、紫微斗数是一套建立在规则统计与经验法则之上的知识体系。随着大模型推理能力快速提升一个有趣的问题出现了AI 到底能不能像命理师一样从一张命盘推出人生事件MingLi-Bench 的价值就在于把会不会算命这件模糊的事变成一组可重复、可对比的大模型评测基准客观判分全部为选择题以与标准答案完全一致作为评分标准不掺主观打分。真实题源题目来自全球算命师大赛2022–2025 年度赛题贴近真实应用场景。多模型横评同一套题跑不同 AI直接对比谁更懂命。上图展示了基于该基准延伸出的多智能体Multi-Agent推理架构由调度器Orchestrator创建多个子智能体分别调用计算工具并回收工具不确定性 / 子智能体不确定性进行多流派合参——这正是把命理推理做到更稳定的工程化思路。二、开箱即用的评测数据集160 道真实命理选择题评测好不好用先看数据。MingLi-Bench 内置了整理好的题目数据集与命盘数据无需自己造题。数据文件内容说明data/data.json160 道标准化选择题按年份与类别组织附标准答案data/fortune_api_results.json预先排好的八字 紫微斗数命盘用case_id与题目关联data/raw/2022–2025 各年度原始赛题文本题目结构与十二大类别每道题包含生辰信息、问题、A/B/C/D 四个选项与正确答案。题目被归入十二大类人生事件覆盖日常最关心的维度事业 · 健康 · 外貌 · 婚姻 · 子女 · 学业 · 官非 · 家庭 · 性格 · 灾劫 · 财运 · 运势你可以只测某一类比如只看婚姻或财运也可以按年份筛选。题目年份分布清晰每年 40 道覆盖 2022–2025 共 160 道。三、快速安装与 API 密钥配置3 步完成无需复杂环境三步即可就绪第 1 步获取项目git clone https://gitcode.com/gh_mirrors/mi/MingLi-Bench cd MingLi-Bench第 2 步安装依赖requirements.txt 里仅几个轻量库pip install -r requirements.txt第 3 步配置 API 密钥命令行从.env文件读取密钥与默认参数。复制模板后只需填写你实际要调用的服务商即可空值会自动忽略cp .env.example .env支持的平台包括OpenAI、Anthropic、Google、DeepSeek、豆包/火山引擎以及OpenRouter一个密钥即可调用大多数模型最省心。⚙️ 配置完成后可先做连通性自检python -m mingli_bench.cli --list-models查看受支持模型--stats查看数据集统计信息。四、一条命令跑通八字 / 紫微斗数评测真正跑评测只需一条命令。以 OpenRouter 方式为例模型名写成provider/model会自动路由python -m mingli_bench.cli --model openai/gpt-4o --year 2025 --cot --astro --max-workers 8命令行入口逻辑集中在 mingli_bench/cli.py评测主流程实现在 mingli_bench/benchmark.py。推荐的两个关键参数官方强烈建议始终开启下面两个开关这也是拿到真实推理能力分数的关键--cot思维链让模型先逐步分析命盘再给答案给推理留出空间。--astro注入命盘把预先排好的八字 / 紫微命盘直接写进提示词把排盘与推理两个环节解耦。这样分数反映的是推理能力而不是模型自己排盘的准确度。✅ 只有当你想单独研究排盘能力或思维链增益时才需要关闭它们做消融实验。五、常用命令行参数与评测结果输出最常用参数一览完整帮助见python -m mingli_bench.cli --help参数默认值作用--model, -m必填模型名含/时按 OpenRouter id 处理--year, -y全部只评某一年2022/2023/2024/2025--categories, -c全部按类别筛选如--categories 事业 婚姻--sample, -s N全部只评前 N 道适合快速自测--cot关加入思维链指令--astro关注入预排八字 / 紫微命盘--shuffle-options关每题随机打乱选项避免位置偏差--max-workers5API 并发数限流时调低每次运行都会在logs/下生成三类结果方便复现与对比产物说明model_results.json每题预测、打分与整体统计model_summary.txt核心指标摘要总准确率、分类明细、平均响应时长model_responses/模型原始响应每题一个独立文件六、项目结构与源码导读仓库结构清晰便于二次开发或接入自定义模型mingli_bench/cli.py命令行入口与参数解析mingli_bench/benchmark.py评测主流程、提示词构建与答案抽取mingli_bench/data/loader.py题目加载、年份 / 类别筛选与选项打乱mingli_bench/data/schema.py题目数据结构与答案匹配规则mingli_bench/models/factory.py模型工厂按需加载各家 SDKmingli_bench/models/OpenAI / Anthropic / Google / DeepSeek / 豆包 客户端实现README_zh.md中文完整文档含提示词示例其中答案抽取逻辑比较稳健会优先识别答案X选择X等显式格式兜底再取文中最后一个独立选项字母减少因表达差异导致的误判。七、使用边界与常见问题Q为什么我测的分数和文档里的不太一样A大模型存在随机性采样、MoE 机制等。团队在正式评测中采用5 轮独立测试 多数投票至少 3 轮答对才算通过并设置Temperature: 0.0。单次跑分会有波动多轮平均更可靠。Q这个分数能代表真实算命水平吗A不能。它衡量的是封闭域选择题推理与选项辨析能力而非开放式对话、个性化诠释与情绪处理。真实命理咨询远比选择题复杂本文结果仅用于技术可行性验证。Q样本量够吗A当前 160 题、4 个年份适合做能力对比与横向评测但不足以验证跨地域、跨题型的泛化能力——这也是后续可扩充的方向。总结MingLi-Bench 把大模型会不会算八字 / 紫微斗数这件模糊的事变成了一套可复现、可对比、带客观标准答案的评测基准内置 160 道真实比赛题、支持主流大模型一键接入、用--cot与--astro精准分离排盘与推理两个环节。三步安装、一条命令你就能得到一份带分类准确率的评测报告。如果你想进一步把命理推理做到更稳定还可以参考项目文档中基于多智能体与不确定性量化的 Agent 化思路在这套基准上继续探索。【免费下载链接】MingLi-BenchA benchmark for evaluating LLMs on Chinese traditional fortune telling — Bazi (八字) and Ziwei Doushu (紫微斗数).项目地址: https://gitcode.com/gh_mirrors/mi/MingLi-Bench创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考