
Modelo de vídeo com IA de próxima geração com narrativa multi-cena, saída 720p e identidade persistente de personagem pela ByteDance.
Seedance 2.0 é o mais recente modelo de geração de vídeo com IA da ByteDance. Ele introduz narrativa multi-cena para sequências de vídeo coerentes, saída de resolução 720p, co-geração nativa de áudio e vídeo e identidade persistente de personagem entre cenas. Comparado ao Seedance 1.5 Pro, oferece renderização 30% mais rápida e controle criativo significativamente aprimorado.
Key specifications of the Seedance 2.0 model.
Max Resolution
Multi-Shot Sequences
Max Duration
Descreva a cena em linguagem natural (até 2.500 caracteres). Anexe imagens de referência para a aparência dos personagens, clipes de vídeo para o estilo de movimento ou arquivos de áudio para o ritmo e o tempo dos diálogos. Use o sistema @ para atribuir uma função a cada arquivo.
Defina o número de cenas (até 6) e especifique o movimento de câmera de cada uma — dolly zoom, travelling, câmera na mão ou fixa. Defina a duração total (até 15 segundos) e a proporção de tela.
O Dual-Branch Diffusion Transformer processa todas as entradas e produz um vídeo multi-shot com áudio sincronizado em uma única passagem de inferência. O preço depende da resolução e da duração: um clipe de 5 segundos custa 100 créditos em 480p ou 215 créditos em 720p.
The @ reference system lets you assign specific roles to each uploaded file: @face for character likeness, @motion for movement style, @style for visual tone, @audio for soundtrack sync. No other model offers this level of compositional control over multimodal inputs.
Dolly zooms, rack focuses, tracking shots, POV switches, smooth handheld — Seedance 2.0 scored 9/10 for camera control in benchmark testing, the highest among competing models. Each shot in a multi-shot sequence can have its own camera behavior.
ByteDance incorporated physics-aware training that penalizes impossible motion during generation. Cloth drapes and wrinkles naturally, water splashes with correct weight, collisions have impact, and characters shift balance when walking.
The Dual-Branch Diffusion Transformer generates audio and video in parallel, not sequentially. Spoken dialogue syncs to lip movement at the phoneme level, foley effects match on-screen action, and environmental ambience adapts to scene changes.
Characters retain their facial features, clothing, hairstyle, and proportions across all shots in a multi-shot video. The internal reference-locking system ensures the same person looks the same regardless of camera angle or scene change.
Generate up to 6 independently controlled camera cuts in a single generation. Each shot can have its own framing, camera movement, and action — the output looks like an edited sequence, not a raw single-take generation.
Multi-shot sequences, physics-aware motion, and quad-modal input — all generated by Seedance models with no post-editing or compositing.






Vídeo 720p com áudio nativo, entrada quadrimodal, identidade de personagem persistente e geração conjunta de áudio. A partir de 100 créditos por um clipe de 5 segundos em 480p.