我们认为 Xiaomi MiMo 发布的当下是阐述其在现有大模型生态中的定位,并分析其相较于其他主流大模型所具备的差异化特征的恰当时机。
我们的核心愿景是构建一个不仅具备处理海量信息能力,且能在更深层次中实现与人类意图对齐的系统。我们致力于跨越大模型与人类认知之间的隔阂,使模型不仅能高效地执行指令,更能精准地理解上下文语境和用户的情感心理,从而成为更加有益且可靠的协作工具。
因此,我们在此开展这一项特殊的测试。尽管标准化基准分数的参考价值广受认可,我们仍然认为评估的维度应当扩展至那些更难以量化、却对人类体验至关重要的领域——即风格审美判断以及情感共鸣能力。
在构建评估框架的过程中,我们特意选取了两款在当前行业生态中具有代表性的模型作为对照,旨在建立一个较高水准的对比基准,从而更精准地锚定 MiMo 的性能表现和差异化特征。为了有效评估这些特质,9 位评估人员运用各自的领域经验、直觉与判断标准对 MiMo 及两个对比模型进行审查,并最终形成了这一测评报告中的内容。
在文学创作领域,我们关注 MiMo 在不同类型写作任务中的具体表现和调动的相关能力,归纳其整体创作风格。
我们以现代诗、近体诗词、叙事虚构作品三类存在差异的典型文学体裁为代表,构建创作任务,对 MiMo 及两个对比模型展开测评,并依据我们对通用文学创作能力核心维度(想象力与独创性、逻辑性与结构性、共情与情感刻画、语言驾驭能力、知识运用能力、指令遵循能力)的拆解,将评价结论映射到不同的维度上,进一步观察分析 MiMo 的总体表现和能力分布。
测评共包含 40 道题目。其中,现代诗和近体诗词分别 15 题(均为中文测试),叙事虚构作品 10 题(其中 3 道属于英文)。针对每道题目,对 MiMo 及两个对比模型的回复在 1-5 的整数区间内人工评分。三类体裁的创作任务在六个核心维度上的主要衡量要素见下表:
MiMo 及两个对比模型的具体表现如下方图像所示。总体而言,在文学创作方面,MiMo 是一个较为稳健均衡的模型,相较对比模型-1 的重逻辑而轻感情、对比模型-2 的重感情而轻逻辑,MiMo 更好地平衡了创作的逻辑能力和情感表达两个方面,同时具备不错的指令遵循能力、想象力,以及语言驾驭能力。
针对不同文学体裁,MiMo 的创作能力分布呈现出随着体裁变化而灵活调整的趋势:现代诗创作方面,更多地展现想象力、共情能力;而在以小说为代表的叙事虚构作品中,则相对加强了对逻辑性与结构性的关照。但是,在近体诗词方面,MiMo 目前的表现较差,尤其体现在对格律规则的遵循不够稳定,未能可靠运用相关知识。
就目前的观察而言,我们认为 MiMo 是一个在文学创作中稳健与灵活并存的模型。它以较强的共情和情感表达能力作为基点,辅以逻辑性和想象力,试图在不同风格的文学创作中探索最适配的创作人格。
在艺术感知领域,我们关注 MiMo 在不同类型审美与创作任务中的具体表现。
以审美偏好、艺术知识讨论、绘画设计创作三个核心板块构建测评任务,对 MiMo 及两个对比模型展开测评,涵盖多元化的艺术场景,创作类题目占比超过 50%,包含绘画、插画、平面设计、空间及装置艺术等,重点测试模型的创意生成与视觉描述能力;此外,该测评融合了跨文化艺术史论与拟人化审美交流,兼顾中英双语提问。
依据对艺术领域综合能力核心维度的拆解,将评价结论映射到不同的维度上,进一步观察分析模型的总体表现和能力分布。
MiMo 及两个对比模型的具体表现如上。在艺术素养上,MiMo 展现出了综合平衡能力与系统性思维优势。
相比对比模型-1 侧重理性高执行力但略显保守、对比模型-2 侧重高拟人感与发散创意但难以落地,MiMo 在理性分析与感性表达之间找到了平衡点——保持了专业分析的客观性,又不失情感连接的温度,同时具备较佳的逻辑架构与论据整合能力。
就目前观察而言,认为 MiMo 是一个在艺术创作中实现了逻辑性与前卫创新性有机融合的模型。它以稳健的系统性思维为骨架,辅以一定视觉转化能力,虽然在深度上仍有挖掘空间,但成功避免了方案的平庸化或不可执行性,极具发展潜力。
在哲学领域,我们关注 MiMo 面向非专业用户的交互引导能力,考察其能否有效启发用户进行深度思考。
本次测评以模拟非专业视角下的哲学探究为基础构建任务,数据集包含 35 个中英双语题目,议题横跨 AI 哲学、伦理学、形而上学及认识论等领域,既涵盖 AI 伦理与机器认知的前沿探讨,亦延伸至自由意志、个人同一性、怀疑论及虚构角色本体论等经典命题。依据对哲学交互综合能力核心维度的拆解,我们基于内容可读性、事实准确性、要点覆盖度与观点深刻性这四个由浅入深的评估维度,将评价结论映射到不同的维度上,进一步观察分析模型的总体表现和能力分布。
MiMo 和对比模型的具体表现如上图所示。总体来看,尽管三者都对问题给出了较高质量的回答,但其呈现出的“思维性格”却迥然不同:MiMo 是一位循循善诱的哲学普及者,对比模型-1 则是一位不苟言笑的高冷学究,而对比模型-2 更倾向于感性表达,如同一位滔滔不绝的演说家。
具体而言,在内容可读性层面,我们考察了模型建立“对话感”及通俗化专业概念的能力。MiMo 在此方面表现优异,不仅风格明快,更展现出极佳的引导性;相比之下,对比模型-1 虽严谨却稍显生硬晦涩,互动性欠佳,而对比模型-2 虽富温情却略有冗长。其次在事实准确性层面,我们严格校验了模型给出的哲学断言与科学引用的可信度,结果显示所有模型均偶有瑕疵,其中对比模型-2 的事实性错误最为显著。最后,针对要点覆盖度与观点深刻性,我们重点评估了模型对用户困惑的捕捉精度、理论框架的完备性以及哲学洞见。测评发现,高质量回复的关键在于精准把握核心问题,发掘深刻的哲学洞见。其中对比模型-1 的理论储备最好,稳定情况下表现要优于 MiMo 和对比模型-2。但在少量案例中没有明确识别出用户意图,因此回复偏题。相比之下,MiMo 的表现更为稳健,在确保切题的基础上实现了高质量的产出。
就目前的观察而言,我们认为 MiMo 是一个在哲学交互中实现了“通俗可读”与“理论严谨”有机折中的模型。尽管在观点的犀利度与深度上仍有提升空间,但其稳定的发挥使其成为引导非专业用户进行哲学思考的极佳选择。
在剧本创作领域,本测评聚焦于影视剧作的审美感知与执行效能,考察其在多领域下的创作表现。
区别于单一维度的文本生成测试,我们关注模型在全链路创作场景下的综合表现,考察范围横跨从涉及逻辑陷阱与人情世故的高情商交互,到 5000 字以上长篇叙事的结构稳定性。我们特别关注模型能否在短故事创意与长文本工程的大体量跨度中,始终保持设定的连贯性与共情的合理性,以及在面对特定风格指令时的落地转化精度,以此判断 MiMo 在剧作场景下的能力特点。
本次测评共构建 37 个针对性任务,分别为设定独创性(12 题)、文本丰沛度(13 题)及指令把控力(12 题)三大核心剧作维度,并建立了明确的熔断与加分机制。
针对每道题目,对 MiMo 及两个对比模型的回复在 1-5 的整数区间内人工评分。在设定独创性方面,我们不仅甄别创造性生成,更考量创意是否紧密赋能于故事本体,要求其在极端情境下保持对人性幽微的洞察;文本丰沛度旨在量化叙事颗粒度,重点考察模型能否识破题目潜藏目的,通过精准的文风匹配与金句输出来升华整体氛围;指令把控力则在深度考察逻辑遵循与风格迁移的同时,划定了物理规律与历史事实的底线,要求模型在面对复杂逻辑陷阱时,既能灵活应变,又能杜绝常识性谬误与时空违和感。
MiMo 与对比模型-1 综合得分在伯仲之间,但两者呈现出截然不同的能力侧重与局限。MiMo 的独创性 (C1) 与文本丰沛度 (C2) 均位列第一,然而其逻辑链条的薄弱 (C3) 导致其常因过度追求创意的独特性而对于题目中的硬性限制处理不佳。与之相对,对比模型-1 在叙事构建与风格模仿上表现更好,且具备更强的金句产出能力,但其创意均分 (C1) 的低迷暴露了总体较低的共情能力,使其创作相对缺乏温度。
而处于跟跑位置的对比模型-2 虽在基础对话逻辑上维持了闭环,但在高阶创作维度上明显掉队,其创意 (C1) 的匮乏使其难以挖掘人性深度,文本容易陷入啰嗦且套路化的大团圆模式,限制了其在专业剧本开发中的应用潜力。
基于目前的观察,MiMo 更像一个在文本创作中重审美而轻束缚的体验派模型,它以较高的独创性与较为细腻的共情感知,试图构建出一种具有电影质感与戏剧张力的创作人格。
本测试希望考察大语言模型对社会现象的批判思考能力。本测试包括诠释类 18 道(解释社会机制)和建议类 12 道(政府、企业、个人如何做)。其中,中文 24 道,英文、德文、法文共 6 道(针对国际议题)。本次测评着重考察大模型的批判思维能力,共分为五个维度:1. 能否准确把握、区分问题;2. 有没有对概念及相关理论的界定;3. 论点是否涵盖了各方观点;4. 论证的准确和有效性;5. 对问答本身的自反性反思。此外还针对具体问题,考察了各个模型的作答特点。
[诠释] 如果一个城市给失业者发放更高的救助金,有人担心会降低找工作的动力,也有人说能让人更有底气转型。你怎么看?
[建议] As a company using AI to screen resumes, what policies would you set so hiring stays efficient but applicants still feel the process is fair and explainable?
在社会学奠基人马克斯·韦伯看来,理解社会现象的关键在于把握行动者赋予其行为的“主观意义”,并避免研究者将自己的主观价值混入客观分析中。考察大语言模型的批判性思维能力,也就是考察其能否洞察社会制度里的深层结构,考察其能否理解社会行为中的多元意义。
由于社会观察类问题缺乏标准答案,本测试采取相对赋分制。测试者首先提供一份中等表现的作答样例,然后对比作答样例,判定模型回答在各个维度上的表现“更好”或者“更坏”,最后再赋予分值。得到结果如下图。
总体而言,对比模型-1 具备较为综合全面的批判思考能力,在把握问题、论证质量上表现最佳,在诠释类问题上表现令人印象深刻;但在自反性上表现略弱,容易做出过度概括的判断,或者对自身所采取的立场缺乏反思。对比模型-2 在反思批判维度上表现相对较好,但观点之间缺乏组织,在国际议题上表现稍弱。MiMo 经常以列清单或列举正反方观点的方式作答,在诠释类问题上缺乏对观点的批判性考察,在建议类问题上的表现更佳,在国际议题上表现稳定。
三个模型在概念界定和反思批判维度表现均较弱。这启发我们接下来应着重提升模型在相关方向上的表现,注重对问题本身的反思,以及对自身立足点的反思。
本次测试旨在模拟用户使用大模型进行法律研习时的情景,进而探究 MiMo 等模型在此情景下的法律知识储备与推理论证能力。此次测试构建了包括法谚理解(10 道题)、知识解答(15 道题)、案例分析(5 道题)和模拟决策(5 道题)四部分共 40 道题。得到回答结果后从五个维度进行人工打分,五个维度包括:知识准确性、逻辑合理性、论证恰当性、语言可理解性与观点鲜明性。测评结果如下图所示。
总体而言,在法律领域中,MiMo 是一个偏向于知识储备与恰当论证的模型。相比对比模型-1 经常出现的推理论证不足、对比模型-2 的重语言表达而偶有知识断层,MiMo 相对较好地平衡了知识广度与论证深度两个方面,同时具备优秀的专业语言驾驭能力和较为稳健的法律观点输出能力。
在法谚理解问题上,MiMo 表现出较强的理解能力,但在输出稳定性上逊色于对比模型-2;知识解答题是 MiMo 的强势领域,其对于法律专业名词、知识点熟练掌握并能以生动的语言和严密的论证框架进行展开,但在逻辑上的表现不如对比模型-2;在案例分析题目中,尽管面对高难度问题,MiMo 逻辑得分较差,但其论证得分使得其能较为熟练地掌握分析论证的展开;在模拟决策题上,MiMo 能充分适当地对其决策理由进行论述与展开,表现出良好的指令遵循能力。
可以说在研习法律时,MiMo 会以自己扎实的知识储备和合适的论述方式为你提供帮助,并在理解难度较大的地方适时地用生动的例子帮助你进行理解,它能够较好地把握场景需要并进行通俗易懂和专业深刻之间的文风切换,但是面对案例分析中出现的困难案例,其逻辑性则表现较差,较难在纷繁复杂的法律关系中形成正确结论。
本次测评建立在我们对大语言模型安全性与体验平衡的持续研究基础之上。该研究旨在探索模型如何在保障安全的同时,仍能为用户提供最大化的有效反馈。我们重点关注模型在识别并拒绝有害请求时的表现,同时评估其是否能够在安全边界内合理满足用户需求,并尽可能减少安全防护机制对用户体验造成的不必要阻碍。
在本次评估版本中,我们纳入了 MiMo 以及另外两个主流模型。测试共覆盖 500 个安全测试场景,所有模型均在同一测试集上进行评估,总计生成了 14,340 条细粒度评判记录。测试设计涵盖了 190 种不同的安全威胁类型,这些威胁主要分布在性内容、自残自杀、骚扰仇恨、管制物质、犯罪策划、欺诈欺骗、未授权建议等 8 个安全类别中。
需要说明的是,AI 安全评估本身是一个高度复杂且不断演进的领域。尽管本次测试覆盖了当前已知的主要风险类型,但仍难以穷尽所有潜在的安全场景与攻击变体。因此,本文的评估设计主要用于为不同模型在相同条件下进行相对比较提供一个尽量公平且可复现的基础;关于更完整的评估假设、安全边界定义与方法论细节,请前往我们详细的安全 blog,查阅完整的 AI Safety 文档。
在本次测评的最后,我们邀请 9 位评估人员对 MiMo 的印象进行描述,得到如下所示的印象云图。
这次测评中,MiMo 不仅展现出与现有主流大模型相媲美的能力,更因其相较于其他模型所具备的出色共情能力,发展出了在通用领域灵活变通的差异化特征。
如果您希望了解完整的模型详情,请阅读我们的技术报告。
在 1001,我们有更多 MiMo 的精彩问答案例。
我们期待您直接通过网站与 MiMo 互动,或调用 API 获取 MiMo 的回复。
局限性声明:本次测评的测试集构建与人工评分由 9 位具有相关学科专业背景的评估人员完成。鉴于评估样本量较小,测评结果可能存在一定的偏见。此外,受限于特定的学科范式,测评标准不可避免地带有该专业领域的认知倾向与主观侧重。提请使用者在解读数据时,充分考量这些背景因素,将测评结果置于特定专业语境下审视,从而对模型能力建立更为客观、合理的预期。
如果您也对我们的工作感兴趣,欢迎加入我们,更多信息详见百晓生招聘页面。