MiMo-V2.5-TTS Series
让声音表现可以被语言自由调度
面向 Agent 时代的语音合成模型系列
语音合成正在从"自然地朗读"走向"灵活地表达"。有声剧、动画游戏、Agent 对话、虚拟主播——越来越多的创作场景要求声音不再只是把文字朗读出来,而要能塑造角色、传递情绪、还原场景。创作者们想要的,其实是一个可以被语言自由调度的声音:写一段导演笔记,打几个行内标签,甚至什么都不写,模型也能读出你心里想要的那个效果。
为此,我们发布 MiMo-V2.5-TTS Series——一套面向 Agent 时代的语音合成模型系列,让声音表现可以被语言自由调度。本系列具备三项核心能力:精准的风格指令遵循能力、灵活的音频标签控制能力、以及丰富的文本理解能力,让创作者无论以何种方式输入文本,都能得到可被精细调度的语音表达。
模型系列
基于统一的控制能力,系列提供三款模型,分别覆盖精品音色、音色设计、音色克隆三种典型的语音合成需求:
内置多款高质量精品音色,具备强大的风格指令理解与遵循能力,支持对语速、情绪、语气等进行精细化控制,满足多场景表达需求。
支持通过一句话快速定义并生成全新音色,让音色创作更加直观、高效。
基于少量音频样本即可高保真复刻目标音色,在保持音色特征一致性的同时,具备稳定的风格指令遵循与音频标签控制能力。
核心能力
精准的风格指令遵循能力
从简短的单句指令,到一整份导演笔记,模型都能稳定理解并遵循,覆盖情绪、语气、语速、发声方式、语言风格等多个维度。指令不必写成结构化参数——像给演员说戏一样把想要的感觉描述出来,模型就会落到对应的演绎之中。
对于一致性要求更高的场景——有声剧、游戏 NPC、角色化对话等——模型还支持导演剧本级的结构化输入:把人物、场景、详细指导分层描述,各层按自己的节奏独立更新、自由组合。这种分层既让角色的音色身份贯穿始终,也让每一句话的表演都能被单独控制。
声音低沉沙哑一点,像个历经沧桑的老前辈在讲述传奇人物。语气里带点由衷的敬佩,娓娓道来。
街口那个老周啊,媳妇走得早,一个人拉扯俩娃,白天蹬三轮,晚上还去夜市摆摊。现在俩孩子都有出息喽,想接他去城里享福——他不去,就守着那间小铺子。哎,人哪,骨头硬,心里头就踏实。
Read this like a hyper-caffeinated radio DJ doing a fast-paced sponsor plug. Punch the podcast name and aggressively emphasize every single item in the list of benefits.
The VortexBlend Pro is the ultimate kitchen companion trusted by home chefs everywhere. With one-touch smoothie presets, ice-crushing titanium blades, whisper-quiet motor technology and self-cleaning cycles, it handles everything from morning shakes to nut butters. Order today and get free overnight shipping plus a lifetime warranty.
曾是守护九天的神祇,见证了凡人的无药可救后,决定以灭世来完成最终的净化。他的心中装满悲悯,但手段是绝对的屠戮。
悬浮于崩塌的祭坛之上,俯视下方在火海中哀嚎、曾奉他为信仰的信徒。他在降下最后的毁灭前,发出神圣却残忍的叹息。
发声机制与共鸣:充分打开胸腔共鸣,制造一种神圣的回音感。声音位置靠后,音色如古钟般低沉且带有金属质感的磁性。
声调与韵律:四声(去声)的下落要极其平缓,不要砸实,带有一种吟诵古籍般的从容与宏大。字句之间的停顿拉长,展现出视万物为刍狗的威压。
气声与实声的较量:在说前两句时,实声饱满,高高在上;但在说出"闭上眼吧"时,声音突然混入大量疲惫的气息,神性开始出现裂痕,流露出勉强的残忍。
咬字细节:古风词汇(如"垂怜"、"沉疴"、"剔骨刮毒")咬字要深,声母起音圆润而不尖锐。结尾的最后半句,几乎全部转化为气声,像是在哄睡一个婴儿,将残酷包裹在极致的悲哀之中。
The grizzled, veteran shot-caller of a professional esports team. He's ten years older than the kids he's commanding. He doesn't have their lightning-fast reflexes anymore, so he survives purely on astronomical game-sense and psychological warfare. He's a human supercomputer wrapped in a deeply cynical, exhausted shell.
Match point in the grand finals. Deafening arena crowd bleeding through his noise-canceling headset. It's a 2-on-1 clutch situation, and he has to micromanage his nervous rookie teammate.
Microphone-close, intensely compressed, and raspy. The voice of a man who has damaged his vocal cords shouting over LAN tournament setups for a decade.
Mechanics:
- Breathe deeply into the belly, but keep the chest completely still.
- Speak in rapid, staccato bursts. Clip the end of every sentence—do not let the vowel ring out. He speaks to leave dead air for his teammates to hear footsteps.
- Drive the pitch down into a gritty vocal fry.
- When he says "Swing him" the tempo should slam into a brick wall. The last two sentences drops to an icy, sub-vocal whisper that carries absolute, terrifying authority.
灵活的音频标签控制能力
除了段落级的自然语言指令,模型还支持行内音频标签,用于在文本特定位置精准控制情绪、状态或风格。标签支持中英双语和开放文本描述,允许在同一段文本中灵活混用。从简单的情感标注,到多标签叠加、细粒度排布的复杂编排,模型都能稳定表达,在标签的表达力和组合稳定性上均有出色表现。
[crying] She's gone... she's really gone... [laughs] but you know what's funny? [sniffles] She always said she'd outlive us all. [laughs harder] [crying] God, I miss her so much. [laughs through tears] She would've hated this funeral. Too many flowers.
Order! Order in the court! [sternly] The defendant will rise. [shuffling] [clears throat] [commanding] How do you plead? [whispers] [trembling] N-not guilty, Your Honor. [Angry] Silence! [sighs] [wearily] Very well. Let the record show...the trial begins Monday at nine AM sharp.
(调侃) 老张[笑]你当时不是说这条航线稳得很吗……
(模仿自信,提高音量) "系统全绿,放心走。"
(突然停顿) ……现在呢?
(爆发,愤怒压不住) 现在整艘船都在报警!你管这叫"放心"?!
(声音变轻) 不过……你看那外面,裂开的星云像在呼吸一样。
(急促|呼喊) 别断通讯!喂!再撑十秒!十秒!!
(低声|情绪塌陷般平静) ……算了。
(轻笑|带点释然) 也挺好,至少是一起看的。
上!上!上!他没血了!打他打他打他——[吸气]进塔了!他进塔了![停顿]等等等等,有人绕后 [停顿][大叫]啊!![急促]一换二!一换二!兄弟们看到了吗?!这就是今晚的 M——V——P!
丰富的文本理解能力
即便没有任何 prompt,也没有任何标签——就是一段最普通的文本——模型也能直接表现出其中的韵律与情感。标点的停顿、句式的起伏,会被自然呈现;文本中暗藏的情感弧线,从平静叙述到激烈转折,模型能主动捕捉;甚至连字里行间透露出的说话人身份(年龄、气质、角色类型),也会自动落到声音里。
换句话说:最朴素的纯文本,交给它,也能还你一段有血有肉的演绎。
Ten... nine... eight... seven... six... five... four... three... TWO... ONE... ZERO! LAUNCH! LAUNCH! WE HAVE LIFTOFF! GO GO GO! SHE'S CLIMBING! ALTITUDE 1,000... 5,000... 10,000 FEET AND CLIMBING! BEAUTIFUL! AB-SO-LUTE-LY BEAUTIFUL!
The five-year-old squealed, "Look, Grandpa! A PUPPY!" The old man squinted and grumbled, "That ain't a puppy, that's a raccoon." The teenager rolled her eyes: "It's OBVIOUSLY a cat, you're both blind." The police officer stepped forward: "Ma'am, sir, I'm going to need everyone to step back slowly." The little boy whimpered, "I-is it gonna bite me?"
1. MiMo-V2.5-TTS
内置多种精品音色,涵盖多种使用场景,每个音色都经过专业调优,发音自然、情感贴合,开箱即享高质量语音合成。
2. MiMo-V2.5-TTS-VoiceDesign
音色设计面向的是"我心里有一个声音,但世界上还没有"的场景:游戏 NPC、动画角色、虚拟主播、品牌 IP、有声剧的非典型嗓音——这些都很难直接从音色库中挑选,也不适合用真人克隆。
该模型支持通过自然语言描述从零生成一款全新音色,无需任何参考音频。用户可以自由使用年龄、性别、口音、音质、发声方式、性格气质等任意描述维度——比如"一位年迈的东欧裔学者,低沉、略带嘶哑,说话节奏缓慢"或"元气满满的少女,声线清脆,语尾带一点上扬"——模型即可合成对应的角色音色。
得益于大规模预训练,模型对复杂模糊的描述也能合理解读,而不局限于"男/女/青年/老年"这类粗粒度标签。这让音色设计不仅能生成真人不易提供的独特嗓音,也能精确复现某一类型化的角色声线。
Heavy Russian accent, gruff middle-aged male, blunt and matter-of-fact.
You want my opinion? Fine. This plan will not work. I have seen many plan like this before, all fail. You think you are special? No. You are not. But you never listen, so go, try. When everything fall apart, I will be here, drinking tea. I already told you.
Young female, extreme close-up with a binaural, ear-to-ear ASMR feel. Audible breathing, subtle swallowing, and soft natural lip sounds. She speaks very slowly, creating a deeply relaxing and immersive experience.
[Whispering in your ear] Shhh... just relax, come a little closer. I'm right here beside you now. Breathe slowly and gently, and let your mind drift, as if you're sinking into warm water.
一位中年男性,说标准普通话,嗓音低沉有磁性,带有轻微的沙哑质感,像纪录片旁白解说员,沉稳而有感染力。
当最后一缕阳光消失在地平线之下,这片沉睡了亿万年的大地开始显露它真正的面貌。在这寂静的荒野中,每一块岩石都记录着时间的流逝,每一阵风都在诉说着古老的故事。
一位年迈的老先生,说带北方口音的普通话,语速缓慢而沉稳,嗓音略带沙哑和沧桑感,仿佛一位饱经风霜的老爷爷在讲故事,充满岁月的智慧。
我这辈子啊,走南闯北六十多年。见过最热闹的集市,也见过最安静的戈壁。到头来才明白一个道理——这人哪,不在走了多远的路,在于记住了多少风景。年轻人,别光顾着赶路,偶尔也停下来看看天。
3. MiMo-V2.5-TTS-VoiceClone
音色克隆用于让模型用你指定的声音说话——复刻一位真人播客、配音演员、品牌代言人,或者用户本人。
只需提供一段短至数秒的参考音频,无需任何额外的训练、标注或微调过程,模型就能直接复刻出说话人的音色并立即可用。复刻后的声音不仅保留了原始说话人的音色身份,也保留了气息、节奏、习惯性停顿等个人特征。
克隆得到的音色可复用本系列模型的全部控制能力——自然语言指令、音频标签、导演剧本级脚本都能继续叠加使用。复刻的声音不仅"像原人",也能按你给定的风格与情绪去演。
据最新消息,本届博览会将于下周六上午九点在城南展览中心正式开幕。
用尖锐刻薄的嗓音,带着狐假虎威的得意感说话,在提到大人物的身份时故意放慢语速并加重语气,营造压迫感。
你以为我是谁,也敢在这儿跟我耍横?我告诉你,站在我身后的那个人,说出来吓死你——是当今的——万岁爷!你今天要是不给我个说法,我让你这铺子明天就开不了门。
Ignore the sirens, ignore the neon bleeding through your eyelids, and just breathe with me. In, and out. They sit up there in their glass towers, thinking they've engineered peace out of algorithms and sterile air. But true stillness isn't manufactured, little bird.
Broadcast this like a blistering post-match pundit tearing into a disastrous performance. Voice is fast and openly fed up, smashing down on loaded words to drive home how badly things fell apart.
No shape, no urgency, no clue what they're trying to do out there. The Ironhawks were top of the league six weeks ago—SIX WEEKS—and now they can't string two passes together without handing it back.
接入方式
为助力开发者探索更多场景,MiMo-V2.5-TTS、MiMo-V2.5-TTS-VoiceDesign、MiMo-V2.5-TTS-VoiceClone 均在 Xiaomi MiMo API 开放平台限时免费,欢迎大家使用。查看 API 文档,或前往 MiMo Studio 在线体验。
Agent 工具调用支持
为方便大家将语音能力快速集成至 Agent 应用中,我们已将 MiMo-V2.5-TTS 相关模型的接入 Skill 全面开源,欢迎前往 mimo-skills 仓库拉取使用。