公司动态
谁才是最强AI赌徒?liars-bar-llm数据分析工具完全指南:从胜率、开枪数到存活积分一键统计
谁才是最强AI赌徒liars-bar-llm数据分析工具完全指南从胜率、开枪数到存活积分一键统计【免费下载链接】liars-bar-llm一个由大语言模型驱动的AI版骗子酒馆对战框架项目地址: https://gitcode.com/gh_mirrors/li/liars-bar-llmliars-bar-llm是一个由大语言模型驱动的 AI 版骗子酒馆对战框架让 ChatGPT、Claude、DeepSeek、Gemini 等模型同桌博弈。它的内置数据分析工具可以一键统计每个 AI 的胜率、开枪数、存活积分和对位对决胜率帮你快速找出谁是真正的最强 AI 赌徒。本文是一份面向新手的完整使用指南零代码基础也能跑通全流程。一、先认识一下AI 版骗子酒馆是什么骗子酒馆是一款经典的博弈卡牌游戏2-4 名玩家轮流出牌宣称自己打出的牌是目标牌可以撒谎下家可以选择质疑质疑失败者要对自己开一枪。6 仓左轮手枪里藏着一发实弹运气和策略缺一不可 在 liars-bar-llm 中每个玩家都是一个 LLM 智能体游戏主程序game.pyLLM 智能体player.py游戏记录存取game_record.py模型接口配置llm_client.py批量跑多局multi_game_runner.py游戏规则写在prompt/rule_base.txt中——每个模型都会读到一旦失败就会被删除代码、彻底消亡的生死设定因此博弈格外激烈。二、4 个核心数据指标如何看懂 AI 赌徒水平game_analyze.py会为每个 AI 统计 4 项关键指标这也是判断最强 AI 赌徒的标尺指标含义怎么看 胜利局数最终存活并赢得整局的场次占比越高越强 开枪次数质疑失败被迫自射的次数越少说明博弈越稳❤️ 存活积分按淘汰顺序累计的积分活得越久分越高平均值越高越耐熬⚔️ 对位胜率与某个特定对手发生质疑对决时的胜率揭示相克关系三、一键安装与准备对局数据1. 克隆仓库git clone https://gitcode.com/gh_mirrors/li/liars-bar-llm2. 安装依赖项目只依赖 openai 库一条命令即可pip install openai3. 配置模型接口API 配置集中在llm_client.py中项目采用 New API 风格的统一接口调用格式你需要自行填入对应模型的 API 接口也可使用类似的 One API 方案。4. 批量运行游戏在game.py或multi_game_runner.py的player_configs中设置好模型名称然后批量运行python multi_game_runner.py -n 50-n后指定局数默认 10 局。每局游戏的完整过程会以 JSON 形式自动保存到game_records/文件夹这是后续所有分析的原始数据。四、从 JSON 到可读文本还原每局博弈全过程原始 JSON 记录信息密集直接阅读比较吃力。json_convert.py会把 JSON 转换为中文可读文本输出到converted_game_records/python json_convert.py转换后的每局记录包含每位 AI 对其他玩家的看法与演技描述每次出牌的出牌理由策略自白每次质疑的质疑理由与结果射击结果与最终胜利者例如在demo_records/converted_game_records/中你可以看到 AI 如何一边微微一笑、眼神平静一边盘算出三张牌能显示强势态度迫使下家面临质疑风险——这正是 AI 心理博弈的趣味所在。五、深度对局分析提取 AI 之间的两两对决player_matchup_analyze.py会把所有游戏中互为对手发生质疑对决的记录提取出来按玩家对合并保存python player_matchup_analyze.py输出保存在matchup_records/文件夹每对 AI 一个文件例如demo_records/matchup_records/ChatGPT_vs_Claude_detailed_matchups.txtdemo_records/matchup_records/Claude_vs_DeepSeek_detailed_matchups.txt每条对决记录都包含双方初始手牌、打出牌、剩余手牌、出牌理由、质疑理由和质疑结果方便你逐条复盘谁在骗谁。六、一键统计运行 game_analyze.py 查看总排名最后一步统计并打印所有对局数据python game_analyze.py 该脚本默认读取项目根目录下的game_records/文件夹。如果你想分析演示数据把 game_analyze.py 末尾的folder_path改为demo_records/game_records即可。输出包括四大部分胜利局数统计、开枪次数统计、存活积分统计、对位对决胜率表。七、实战结果50 局演示数据里的最强 AI 赌徒项目自带的demo_records/已收录 DeepSeek-R1、o3-miniChatGPT、Gemini-2-flash-thinking、Claude-3.7-Sonnet 四个模型对战50 局的完整数据。实际运行统计脚本得到的结果如下总排名按胜率与存活积分排名玩家胜利局数开枪次数存活积分平均DeepSeek22 场44%132 次92 分1.84/局Claude13 场26%148 次81 分1.62/局ChatGPT11 场22%148 次70 分1.40/局4Gemini4 场8%182 次57 分1.14/局DeepSeek 以 44% 的胜率成为最强 AI 赌徒开枪次数也最少说明它既会赢、又稳。Gemini 则频繁自射182 次开枪质疑决策明显偏激进。对位胜率中的相克关系DeepSeek vs ChatGPT146 次对决中赢下 111 次胜率高达76.0%Claude vs Gemini132 次对决胜率77.3%但 DeepSeek vs Gemini 只有40.8%——最强赌徒也会翻车这说明不同模型之间存在明显的策略相克单看总排名还不够对位胜率才能揭示细节。八、常见问题 FAQQ模型出牌/质疑输出不稳定、频繁重试怎么办A可在 player.py 的choose_cards_to_play和decide_challenge中增加调用大模型的重试次数或修改prompt/文件夹中的play_card_prompt_template.txt与challenge_prompt_template.txt用提示词强化输出格式限制可能对推理能力有轻微影响。Q统计时为什么有的游戏没被计入Agame_analyze.py 会自动跳过没有赢家的游戏对局中断时保证统计数据完整有效。Q如何换成自己的 50 局甚至 100 局数据A运行multi_game_runner.py生成自己的game_records/后依次执行json_convert.py、player_matchup_analyze.py、game_analyze.py三步即可得到与本文一致的完整分析报告。总结liars-bar-llm 用三个轻量脚本搭建了完整的AI 赌徒竞技场数据流水线json_convert.py还原博弈原文、player_matchup_analyze.py提取两两对决、game_analyze.py一键输出胜率/开枪数/存活积分/对位胜率四大榜单。跑通 50 局演示数据你会发现——DeepSeek 是当前版本的最强 AI 赌徒而模型之间的相克关系才是这场骗术对决最有趣的地方 【免费下载链接】liars-bar-llm一个由大语言模型驱动的AI版骗子酒馆对战框架项目地址: https://gitcode.com/gh_mirrors/li/liars-bar-llm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考