{"version":"1","model":{"id":"fal-ai/minimax/speech-02-turbo","name":"MiniMax Speech-02 Turbo","kind":"audio","availability":"available","available":true,"restricted":false,"api_key_only":false,"description":"MiniMax's faster, more affordable TTS model with the same 37-language coverage and voice personas as Speech-02 HD at a lower cost.","pricing_note":"~$0.06 / 1k chars","categories":["narrate"],"prompt_required":true,"prompt_supported":true,"supports":{},"aspect_ratios":[],"resolutions":[],"durations":[],"base_credits":1,"api_gross_margin_percent":20,"added_at":"2026-05-19","popularity_rank":40,"example_prompt":"Breaking news: markets surged today as tech stocks led a broad rally. Analysts say the momentum could continue through the quarter.","preview":{"image":"/images/model-previews/generated/minimax-speech-02-turbo-v1.webp"},"schema_url":"/api/v1/models?id=fal-ai%2Fminimax%2Fspeech-02-turbo","input_schema":{"$schema":"https://json-schema.org/draft/2020-12/schema","$id":"https://www.artemotion.ai/api/v1/models?id=fal-ai%2Fminimax%2Fspeech-02-turbo","title":"MiniMax Speech-02 Turbo generation request","description":"Request body accepted by POST /api/v1/generate for fal-ai/minimax/speech-02-turbo.","type":"object","properties":{"model_id":{"type":"string","const":"fal-ai/minimax/speech-02-turbo","description":"ArtEmotion model identifier."},"extra":{"type":"object","additionalProperties":true,"description":"Model-specific settings may also be nested here."},"max_credits":{"type":"number","minimum":1,"description":"Reject before submission if the estimated list price exceeds this cap."},"webhook_url":{"type":"string","format":"uri","maxLength":2048},"webhook_secret":{"type":"string","maxLength":512},"folder_id":{"type":"string"},"prompt":{"type":"string"},"voice_id":{"title":"Voice","description":"MiniMax pre-trained voice persona.","default":"Wise_Woman","type":"string","enum":["Abbess","Calm_Woman","Casual_Guy","Decent_Boy","Deep_Voice_Man","Determined_Man","Elegant_Man","Exuberant_Girl","Friendly_Person","Imposing_Manner","Inspirational_girl","Lively_Girl","Lovely_Girl","Patient_Man","Sweet_Girl_2","Wise_Woman","Young_Knight"]},"language_boost":{"title":"Language Boost","description":"Boosts recognition accuracy for the selected language. Use Auto for mixed-language text.","default":"auto","type":"string","enum":["auto","English","Chinese","Chinese,Yue","Japanese","Korean","Spanish","French","German","Portuguese","Arabic","Hindi","Russian","Dutch","Turkish","Italian","Polish","Swedish","Ukrainian","Vietnamese","Indonesian","Thai","Romanian","Greek","Czech","Finnish","Danish","Hebrew","Malay","Slovak","Croatian","Hungarian","Norwegian","Bulgarian","Slovenian","Catalan","Afrikaans","Nynorsk"]},"speed":{"title":"Speed","description":"Speech speed multiplier (0.5–2.0).","default":1,"type":"number","minimum":0.5,"maximum":2,"multipleOf":0.05},"vol":{"title":"Volume","description":"Output volume level (0.01–10). 1 is the default.","default":1,"type":"number","minimum":0.01,"maximum":10,"multipleOf":0.05},"pitch":{"title":"Pitch","description":"Voice pitch shift in semitones (-12 to +12). 0 is unchanged.","default":0,"type":"number","minimum":-12,"maximum":12,"multipleOf":1},"emotion":{"title":"Emotion","description":"Emotional tone of the generated speech.","default":"","type":"string","enum":["","happy","sad","angry","fearful","disgusted","surprised","neutral"]},"english_normalization":{"title":"English Normalization","description":"Improves number reading (e.g. dates, prices). Adds slight latency.","default":false,"type":"boolean"},"output_format":{"title":"Output Format","description":"Format of the output content (non-streaming only).","default":"hex","type":"string","enum":["url","hex"]},"tone_list":{"title":"Tone List","description":"Pronunciation replacements in 'text/(pronunciation)' format. For Chinese, use tones 1–5.","type":"array","items":{"type":"string"}},"as_format":{"title":"Audio Format","description":"Output audio encoding format.","default":"mp3","type":"string","enum":["mp3","pcm","flac"]},"as_sample_rate":{"title":"Sample Rate","description":"Sample rate of the generated audio in Hz.","default":"32000","type":"number","enum":[8000,16000,22050,24000,32000,44100]},"as_bitrate":{"title":"Bitrate","description":"Audio bitrate in bits per second.","default":"128000","type":"number","enum":[32000,64000,128000,256000]},"as_channel":{"title":"Channels","description":"Number of audio channels.","default":"1","type":"number","enum":[1,2]}},"required":["model_id","prompt"],"additionalProperties":false},"parameters":[{"key":"voice_id","label":"Voice","type":"select","default":"Wise_Woman","options":["Abbess","Calm_Woman","Casual_Guy","Decent_Boy","Deep_Voice_Man","Determined_Man","Elegant_Man","Exuberant_Girl","Friendly_Person","Imposing_Manner","Inspirational_girl","Lively_Girl","Lovely_Girl","Patient_Man","Sweet_Girl_2","Wise_Woman","Young_Knight"],"description":"MiniMax pre-trained voice persona."},{"key":"language_boost","label":"Language Boost","type":"select","default":"auto","options":["auto","English","Chinese","Chinese,Yue","Japanese","Korean","Spanish","French","German","Portuguese","Arabic","Hindi","Russian","Dutch","Turkish","Italian","Polish","Swedish","Ukrainian","Vietnamese","Indonesian","Thai","Romanian","Greek","Czech","Finnish","Danish","Hebrew","Malay","Slovak","Croatian","Hungarian","Norwegian","Bulgarian","Slovenian","Catalan","Afrikaans","Nynorsk"],"description":"Boosts recognition accuracy for the selected language. Use Auto for mixed-language text."},{"key":"speed","label":"Speed","type":"number","default":1,"min":0.5,"max":2,"step":0.05,"description":"Speech speed multiplier (0.5–2.0)."},{"key":"vol","label":"Volume","type":"number","default":1,"min":0.01,"max":10,"step":0.05,"description":"Output volume level (0.01–10). 1 is the default."},{"key":"pitch","label":"Pitch","type":"number","default":0,"min":-12,"max":12,"step":1,"description":"Voice pitch shift in semitones (-12 to +12). 0 is unchanged."},{"key":"emotion","label":"Emotion","type":"select","default":"","options":["","happy","sad","angry","fearful","disgusted","surprised","neutral"],"description":"Emotional tone of the generated speech."},{"key":"english_normalization","label":"English Normalization","type":"toggle","default":false,"description":"Improves number reading (e.g. dates, prices). Adds slight latency."},{"key":"output_format","label":"Output Format","type":"select","default":"hex","options":["url","hex"],"description":"Format of the output content (non-streaming only)."},{"key":"tone_list","label":"Tone List","type":"string_array","description":"Pronunciation replacements in 'text/(pronunciation)' format. For Chinese, use tones 1–5."},{"key":"as_format","label":"Audio Format","type":"select","default":"mp3","options":["mp3","pcm","flac"],"description":"Output audio encoding format."},{"key":"as_sample_rate","label":"Sample Rate","type":"select","default":"32000","options":["8000","16000","22050","24000","32000","44100"],"description":"Sample rate of the generated audio in Hz."},{"key":"as_bitrate","label":"Bitrate","type":"select","default":"128000","options":["32000","64000","128000","256000"],"description":"Audio bitrate in bits per second."},{"key":"as_channel","label":"Channels","type":"select","default":"1","options":["1","2"],"description":"Number of audio channels."}]}}