Skip to main content

Audio Models

DUTO provides multiple AI models for generating speech, sound effects, and synchronized audio for videos.

Text to Audio​

Kling Text-to-Audio​

Audio generation from text prompts

kwaivgi/kling-text-to-audio
AttributeValue
QualityGood
SpeedMedium
Duration5-30s (configurable)
ProviderKwaivgi (via WaveSpeed)

Features:

  • Text-prompt-based audio generation
  • Configurable duration (5s to 30s, in 5s steps)
  • Music, sound effects, and ambient audio

Usage:

  • Connect a Text Prompt node with a description of the desired audio
  • Set duration using the slider on the node
  • Audio is generated asynchronously and polled for completion

Video Foley​

Hunyuan Video Foley​

Automatic sound effects for video

wavespeed-ai/hunyuan-video-foley
AttributeValue
QualityGood
SpeedMedium
ProviderWaveSpeed AI

Inputs:

  • Video (required) - Source video to generate foley for
  • Description (optional) - Text prompt to guide sound generation

Capabilities:

  • Analyzes video content automatically
  • Generates synchronized sound effects
  • Supports prompt-guided audio generation
  • Outputs video with added foley audio

Best for:

  • Adding sound effects to silent videos
  • Environmental ambience
  • Action-synced sounds

MMAudio​

Multi-Modal Audio Generation​

mmaudio
AttributeValue
QualityHigh
SpeedMedium
ProviderMMAudio (via WaveSpeed)

Inputs:

  • Video (required) - Source video
  • Description (optional) - Text prompt for audio guidance

Capabilities:

  • Scene-appropriate audio generation
  • Music and sound effects
  • Ambient soundscapes
  • Motion-to-sound mapping

Best for:

  • Full audio design for video
  • Scene-matched background audio
  • Synchronized timing

Kling Video to Audio​

Kling-Optimized Audio​

kling/video-to-audio
AttributeValue
QualityHigh
SpeedMedium
ProviderKwaivgi (via WaveSpeed)

Inputs:

  • Video (required) - Source video

Features:

  • Optimized for video content analysis
  • Style-appropriate audio generation
  • Good motion synchronization

Lip Sync​

Audio-Visual Synchronization​

lip-sync

Available Models:

ModelProviderKey Feature
veed/lipsyncVeedDefault, reliable
kwaivgi/kling-lipsync/audio-to-videoKlingGood quality sync
sync/lipsync-2Sync LabsSync mode options
sync/lipsync-2-proSync LabsPro quality
wavespeed-ai/infinitetalk/video-to-videoInfiniteTalkPrompt support, resolution options
wavespeed-ai/infinitetalk-fast/video-to-videoInfiniteTalkFast generation

Inputs:

  • Video (required) - Source video with visible face
  • Audio (required) - Audio to sync
  • Prompt (optional, InfiniteTalk only) - Text guidance

Model-specific settings:

  • Sync Labs: Sync mode (loop, bounce, cut off, silence, remap)
  • InfiniteTalk: Resolution (480p, 720p), Seed for reproducibility

Use cases:

  • Dubbing videos in different languages
  • Voice replacement
  • Voiceover synchronization

Audio Model Comparison​

ModelPurposeInputsQualitySpeed
Kling Text-to-AudioGenerate from textText promptGoodMedium
Hunyuan Video FoleySound effectsVideo + optional textGoodMedium
MMAudioFull audio designVideo + optional textHighMedium
Kling Video-to-AudioVideo audioVideoHighMedium
Lip Sync (6 models)Sync audio to faceVideo + audioGoodVaries

Workflow Patterns​

Adding Sound Effects to Video​

Video → Video Foley → Output (video with foley)

Adding Voice to Video​

Text Prompt → Text to Audio → (audio)
Video → Lip Sync ← (audio) → Output

Complete Audio Design​

Video → MMAudio → (audio + video)
Video → Video Foley → (video with effects)

Text-based Audio Creation​

Text Prompt ("ocean waves, seagulls") → Text to Audio → Output (audio file)

Audio Quality Tips​

Text to Audio​

  • Be descriptive about the desired audio style and content
  • Set appropriate duration for your needs
  • Use clear descriptions of instruments, sounds, or environments

Video Foley​

  • Higher quality source video produces better sound matching
  • Use the optional description input to guide sound generation
  • Clear visual actions get better foley effects

Lip Sync​

  • Ensure clear face visibility in the video
  • Use high-quality audio input
  • Audio and video durations should be reasonably matched
  • Try InfiniteTalk for prompt-guided results
  • Use Sync Labs models for sync mode control (loop, bounce, etc.)