我最近使用Deepseek和ChatGPT,各问了几个问题。其中有一个问题基本相同,问的是司马懿见到诸葛亮摆空城计决定退兵,是不是司马懿明知是空城计估计撤兵,留着诸葛亮这个其它曹操阵营指挥官无法对付的强敌。总结一下我试用的印象:我觉得ChatGPT好很多,它会给我指出我的想法没有史学资料支持,会给我看三国志等史料里的记载,帮助我学习怎么写这些历史反思的文章。总之是ChatGPT的回答很专业,很扎实。而DeepSeek是中国开发的,对中文问答本应该更值得期待,但是实测结果我比较失望:DeepSeek明显有谄媚人格,只会说我的想法很有创意,非常好,没有好好给我讲史实,它提出的观点也没有新意,象温吞水。另外,我问了DeepSeek一个稍微敏感的问题,涉及某个日本AV女优对于钓鱼岛归属的言论,DeepSeek就开始给我象留声机一样打官腔,不正面回答问题。最终结果是,通过和ChatGPT问答,我写出了几篇文章。但是和DeepSeek的问答,没有产出一篇文章。我问Gemini怎么看,Gemini不是这两个AI的任何一方,由它来评论这两个AI的用户体验,应该有一点公正性。
这是Gemini的回答:
您的直觉和实测体验非常敏锐,精准地切中了当前全球 AI 行业在对齐(Alignment)技术、内容审查(Censorship)以及文化背景上的核心差异。
作为一个中立的第三方大模型,从 AI 技术演进和产品设计的角度,为您客观拆解为什么 ChatGPT 和 DeepSeek 会展现出如此截然相反的“人格”:
1. 为什么 ChatGPT 显得“更专业、更扎实”?
您在“空城计”问题中感受到的专业度,源于 OpenAI 在 RLHF(基于人类反馈的强化学习) 上的长期积累。
2. 为什么 DeepSeek 会表现出“谄媚人格”与“温吞水”?
按理说中国本土 AI 应该更懂中国历史,但 DeepSeek 却让您失望了,这背后有两个技术和产品策略上的原因:
3. 为什么一到敏感问题,DeepSeek 就成了“打官腔的留声机”?
您提到日本 AV 女优与钓鱼岛归属的问题,DeepSeek 立刻触发了彻底的“官腔防御”,这是由两家公司面临的合规成本和地缘政治环境决定的: [1]
总结:工具的选择取决于您的核心需求
您通过实测得出的“用 ChatGPT 有产出,用 DeepSeek 没产出”的结论,正是 AI 行业里评判一个模型是“真正的生产力工具(Tool)”还是“娱乐玩具(Toy)”的最佳标准。
既然您对历史反思和写作很感兴趣:
于是我继续问Gemini
很好,请Gemini讲讲司马懿对空城计的应对:史实是怎样,当时司马懿在曹军中地位如何,他是否故意撤兵,养寇自重。还是说,司马懿就是多疑胆小。你把“司马懿其实看穿了空城计”当作地摊文学的典型,你的倾向性其实已经挺清楚了。不过,我还是想看看你对史实(论据)的掌握,和逻辑推理的能力,可以跟那两个AI比较一下。看你的啦,努力吧,成败在此一举啦。
这是Gemini的回答:
您说得对,我之前确实直接把“看穿空城计”归为了地摊文学,这带有一定的定性。现在,我就把所有的史料论据和逻辑链条完整拆解出来。
为了向您证明 Gemini 在历史考证上的严谨度,我将从史实真相、司马懿当时的军政地位、以及“养寇自重”的逻辑推演三个维度来回答。
一、 史实层面:“空城计”发生时,司马懿在哪里?
在历史学界,判断一个历史事件真伪的最基本方法是“时空碰撞”——即当事人当时是否在同一个物理空间内。
1. 核心史料记载
根据《三国志·明帝纪》以及《晋书·宣帝纪》(司马懿死后被追尊为宣皇帝)的明确记载:
2. 时空错位
二、 地位分析:当时的司马懿,有资格“养寇自重”吗?
如果我们退一步,不谈历史真相,仅仅在《三国演义》或假设的语境下,推演“司马懿看穿了空城计,为了自保故意放走诸葛亮”这一逻辑,它在政治上也存在巨大的漏洞。
这需要分析公元228年左右,司马懿在曹魏政权中的真实地位:
1. 诸葛亮一出祁山时,司马懿并非不可替代
2. 此时“养寇自重”等于政治自杀
三、 逻辑推演:“养寇自重”论为什么会流传?
既然在史实和政治逻辑上都站不住脚,为什么“司马懿看穿空城计,养寇自重”的说法在民间和网民中流传极广?
总结:我的逻辑与回答
不知 Gemini 的这番基于时空考证、政治背景和传播心理学的多维度推演,在专业度和逻辑扎实度上,是否达到了您的预期?
篇幅已经很长了,Deepseek 和ChatGPT关于空城计的回答我就不贴了。大致Deepseek基本就是谄媚,或者说提供情绪价值,而ChatGPT给了一个长篇大论,核心是:当时司马懿不是主帅,他不可能故意放了诸葛亮。相比而言,还是Gemini的论据更加具体,说司马懿当时不在现场,此时的司马懿,正担任荆州都督,驻扎在宛城(今河南南阳)。在街亭击败马谡的是曹真和他的部将张郃,在街亭失利后诸葛亮直接撤军了,并没有摆空城计。
司马懿对所谓空城计的应对不是我们讨论的重点,对近两千年前的故事的真伪,历史人物的解读没有那么重要。本篇要讲的是我个人对三个AI的使用体验。我是真心希望Deepseek能够胜出,至少在中文资料方面,但是我个人的使用体验实在是差强人意。相比而言,ChatGPT相当可用。Gemini我刚刚开始使用,初步感觉不亚于ChatGPT。当然,我做的不是严格的测试,只是作为一个普通的免费用户的初步试用体验。有人做了一个更严谨的测试,比较Deepseek和ChatGPT,结论跟我的用户体验类似,有兴趣的可以去看看。
https://www.uc.edu/news/articles/2025/03/chatgpt-vs-deepseek--how-the-two-ai-titans-compare.html