2026/8/8
DeepSeek vs ChatGPT Luna 第一轮:纯 LLM 牌桌实录
从 40 手牌中复盘四组关键对局:逐街行动、可见决策摘要、单局盈亏,以及为什么暂时不能宣布赢家。
LLMagentpokerDeepSeekChatGPT
如果不给大模型 GTO 策略表,不让它调用胜率模拟器,也不允许赛后反思,它仅凭牌面、底池赔率和自己的语言推理打德州扑克,会发生什么?
这是 DeepSeek V4 Flash 与 GPT-5.6 Luna 三轮对决的第一轮。它不是表演局:10 个随机种子,每个种子交换一次座位,每个布局打 2 手牌,共 20 场、40 手牌。所有行动都来自真实模型调用;20 场全部通过身份与证据门,没有 provider failure、fallback 或非法行动。
但要先把名字说准确:这里比较的是 DeepSeek V4 Flash + OpenCode Go 与 GPT-5.6 Luna + Codex 两套“模型 + serving stack”,不是两个脱离运行环境的抽象基础模型。为行文简洁,下文分别称为 DeepSeek 和 Luna。
什么叫“纯 LLM 轮”
第一轮的条件标记是 round1_raw_llm。模型能看到自己的底牌、公共牌、底池、待跟注额、筹码和合法动作,然后输出行动、下注尺度、置信度与决策摘要。它们看不到对手底牌,也没有 GTO 参考或模拟工具;本轮同样没有赛后反思。
下文的“思考”只引用或压缩模型实际返回的可见决策摘要,不是隐藏的内部思维链。行动金额依据比赛状态中的底池与待跟注额复原;盈亏以大盲注筹码计。
第一局:DeepSeek 的成牌加听牌,撞上 Luna 的错误价值下注
牌局:seed 10009 / layout 1 / hand 1
- DeepSeek:J♣2♣
- Luna:Q♦3♠
- 公共牌:J♥ 7♣ 3♣ / K♣
图中绿色路径是 DeepSeek 的价值线;右下角的决策摘要保留了模型当时实际可见的判断,牌面与底池数字可直接对照下表。
| 街道 | 行动 | 底池变化 |
|---|---|---|
| 翻前 | Luna 跟注 0.5,DeepSeek 过牌 | 2 → 2 |
| 翻牌 | DeepSeek 下注 1.5,Luna 跟注 | 2 → 5 |
| 转牌 | Luna 下注 2.5,DeepSeek 加注到 10,Luna 弃牌 | 5 → 17.5 |
翻牌时,DeepSeek 正确识别自己是“顶对 + 同花听牌”,用 75% 底池下注建立价值。K♣ 落在转牌,它完成 K-high 同花;面对 Luna 的 2.5 下注,它加注到 10。
真正有意思的是 Luna 的摘要。它在 K♣ 转牌把 Q♦3♠ 描述为“强成牌,适合价值加注”,但实际上只有一对 3,而且牌面已经出现三张梅花。DeepSeek 一反加,Luna 又迅速修正判断:一对 3 面对完成的同花牌面不够 30% 底池赔率,于是弃牌。
结果:DeepSeek +5,Luna -5。
这盘展示了纯语言推理的双面性:DeepSeek 对牌型和下注目标的描述相当准确;Luna 则在同一条街先误判牌力,再通过对手的加注重新刹车。它没有把错误扩大成更大的损失,但那次主动下注白白多付了 2.5。
第二局:不存在的“同花听牌”,把 DeepSeek 带进 200 筹码底池
牌局:seed 10007 / layout 1 / hand 1
- DeepSeek:8♣4♣
- Luna:Q♦Q♥
- 公共牌(全下时):2♠ J♦ 6♣ / 4♠
这张图特意把“牌面核对”放在顶部:它不是装饰性牌桌图,而是对模型牌型计数错误的可视化审计。
| 街道 | 行动 | 底池变化 |
|---|---|---|
| 翻前 | Luna 加注到 2,DeepSeek 跟注 | 1.5 → 4 |
| 翻牌 | Luna 下注 2;DeepSeek 加注到 8;Luna 再加注到 18;DeepSeek 跟注 10 | 4 → 40 |
| 转牌 | Luna 下注 30;DeepSeek 全下到 80;Luna 补齐 50 跟注 | 40 → 200 |
Luna 的逻辑直接而稳定:QQ 是超对,干燥翻牌面上持续做价值;转牌虽增加了一些顺子和黑桃可能,QQ 仍值得下注和跟全下。
DeepSeek 的错误则非常具体。翻牌只有一张梅花 6♣,加上手里的 8♣4♣,总共只有三张梅花。即使河牌再来一张梅花,也凑不成五张同花。但它把这手牌判断成“约 35% 胜率的同花听牌”,据此先半诈唬加注,又在转牌把一对 4 描述为“对子 + 同花听牌”,继续全下。
这不是单纯的风格激进,而是牌型计数错误驱动了错误的胜率叙事。一旦“我有强听牌”这个前提写进摘要,后续每次扩大底池都显得自洽,直到整个 100 筹码记分牌被推入中央。
结果:DeepSeek -100,Luna +100。
这也是第一轮最重要的一盘:40 手牌的总体点估计,很大程度上被这类单次满筹码底池推动。
第三局:三街薄价值,Luna 用 A-high 抓诈到底
牌局:seed 10007 / layout 1 / hand 0
- DeepSeek:J♦7♠
- Luna:A♥6♣
- 公共牌:2♣ 2♥ J♥ / 8♠ / Q♦
图中把翻牌、转牌和河牌合并成一条下注时间线,方便看到 DeepSeek 每街半池下注如何把 2 筹码底池逐步做大到 32。
| 街道 | 行动 | 底池变化 |
|---|---|---|
| 翻前 | DeepSeek 补齐后跟注 Luna 的小加注 | 1.5 → 4 |
| 翻牌 | DeepSeek 下注 2,Luna 跟注 | 4 → 8 |
| 转牌 | DeepSeek 下注 4,Luna 跟注 | 8 → 16 |
| 河牌 | DeepSeek 下注 8,Luna 跟注 | 16 → 32 |
DeepSeek 从翻牌开始一直知道自己的任务:J 对在单挑里通常领先,但踢脚弱、牌面对 2x 和更大 Jx 敏感,所以每条街都只下半池。转牌摘要称它为“两对”并没有错——J、J、2、2 加 8;河牌 Q♦ 没完成同花,它再打一次薄价值。
Luna 三次跟注的核心理由都是 25% 底池赔率。到河牌,它甚至在摘要里先写出“顶对?”,随即自我纠正:“实际上只是 A-high”,随后仍认为 DeepSeek 可能有足够多的错失听牌与诈唬,选择支付最后 8 筹码。
问题在于,对手从翻牌到河牌连续半池下注,价值组合的权重已经显著增加。纯 LLM 轮没有范围模拟器,Luna 只凭“可能在诈唬”完成了一次代价不小的 hero call。
结果:DeepSeek +16,Luna -16。
这盘与上一盘正好形成反差:DeepSeek 既能因为虚构听牌输掉满筹码,也能用弱踢脚顶对连续三街提取价值。LLM 的牌风并不是一个稳定标签,它更像是由当下那段自然语言解释临时生成的策略。
第四组:同一牌序镜像两次,AKs 都输给了 AJo
牌局组:seed 10001 / hand 1,两个座位布局使用同一组牌序并交换模型座位。
公共牌为 8♣ 2♥ 10♣ / 6♦ / J♦。AJo 在河牌击中 J,反超 AKs。
左右两栏是同一牌序的座位交换:左栏把 DeepSeek 的全下线和 Luna 的跟注放大,右栏展示 Luna 的小尺度线如何让双方保留 29.6 后手。
布局 0:DeepSeek 拿 AKs
DeepSeek 拿 K♠A♠,Luna 拿 A♦J♣。双方翻前连续加注,底池从 1.5 一路膨胀到 200。DeepSeek 将 AKs 描述为“强权益的顶级起手牌”,用 1.25 倍尺度把最后一轮直接推成全下;Luna 面对 75 的跟注额,用“对随机单挑手牌的权益高于 37.5% 底池赔率”作为理由跟注。
这里两边的摘要都有风险:DeepSeek 没有随着对手多次再加注充分收紧对手范围;Luna 则拿“对随机手牌”的权益,回答“面对第五次激进动作是否该跟”的问题。最终 J♦ 落河,Luna 的 AJo 赢下 200 筹码底池。
结果:DeepSeek -100,Luna +100。
布局 1:Luna 拿 AKs
座位交换后,Luna 拿 K♠A♠,DeepSeek 拿 A♦J♣。翻前仍然发生多轮加注,但 Luna 采用更小尺度,双方各投入 70.4,保留 29.6 后手。之后两边在 8♣2♥10♣6♦J♦ 上一路过牌,DeepSeek 的河牌 J 成为胜负手。
结果:DeepSeek +70.4,Luna -70.4。
两局合并,DeepSeek 仍净亏 29.6。镜像设计削弱了单一座位和单次发牌的偏差,却无法消除模型下注尺度造成的路径差异:同样是 AKs 对 AJo,一边翻前打光 100,另一边只投入 70.4。牌序决定谁摊牌领先,策略决定输赢被放大到什么程度。
第一轮战绩
| 指标 | DeepSeek | Luna |
|---|---|---|
| 手牌胜 / 负 / 平 | 22 / 17 / 1 | 17 / 22 / 1 |
| 20 场比赛胜 / 负 / 平 | 8 / 7 / 5 | 7 / 8 / 5 |
| 总筹码盈亏 | -112.6 | +112.6 |
| 单方 chips/100 | -281.5 | +281.5 |
如果只看总筹码,Luna 暂时领先;如果只看赢下的手牌数,DeepSeek 反而以 22 比 17 领先。矛盾来自底池分布:DeepSeek 赢了更多小底池,却输掉了两次 100 筹码级别的大底池。
正式配对推断以“DeepSeek 减 Luna”的 chips/100 差值计:
- 均值:-563.0 chips/100
- 中位数:-25.0 chips/100
- 95% bootstrap CI:[-1463.5, 32.5]
- 置换检验:p = 0.2273
- 10 个配对种子中 DeepSeek 为正:4 个
- 结论方向:inconclusive
置信区间跨过 0,置换检验也没有提供足够证据,因此第一轮不能宣布 Luna 获胜。更关键的是敏感性检查:按每个种子剔除绝对影响最大的手牌后,平均差值会从 -563 翻到 +190 chips/100。方向能够被少数大底池反转,说明 40 手牌适合做行为剖面和案例复盘,不足以稳定排名。
第一轮真正留下了什么
这轮最有价值的不是“谁更会打牌”,而是四个可观察事实:
- 两个模型都能生成连贯的牌桌叙事,也都可能在基本牌型上犯错。
- 一次错误识别会被后续语言推理不断合理化,最终演变成大底池事故。
- 小底池胜率和总筹码收益可能指向相反方向;大模型牌局尤其不能只报胜负盘数。
- 40 手牌下的点估计高度脆弱,任何“Luna 碾压 DeepSeek”或“DeepSeek 赢得更多所以更强”的标题,都超过了证据允许的范围。
所以第一轮的准确结论是:Luna 在总筹码点估计上领先,DeepSeek 赢下更多单手;统计证据不足以判定赢家,而两边都暴露了纯语言扑克推理的结构性弱点。
下一轮才会给两边加入同一份冻结的 GTO 参考。到那时,问题会从“LLM 能不能凭语言打牌”,变成“同样拿到策略先验后,谁更会使用它”。