AnyTalk gera animação de fala sem dados de animação
O método adapta modelos de difusão de vídeo para criar animações de fala em personagens 3D com sincronização labial.
Por que importa
O trabalho aponta para um caminho com menos dependência de dados para animação de fala de personagens, reduzindo a necessidade de conjuntos de treinamento específicos por personagem, rigging ou re-meshing. Se validado em ambientes de produção, priors de movimento baseados em difusão podem facilitar a implantação de avatares 3D com sincronização labial em diferentes malhas e sistemas de blendshape.
Pontos-chave
- 1.Gera animação de fala 3D com sincronização labial para personagens arbitrários.
- 2.Usa ajuste fino do personagem sem dados de animação.
- 3.AnyTalk_RT destilado mira desempenho em tempo real.
Pesquisadores apresentaram o AnyTalk, um método para gerar animações de fala em 3D para personagens arbitrários sem exigir dados de animação. A abordagem faz ajuste fino de um modelo de difusão de vídeo pré-treinado usando imagens renderizadas de um personagem 3D-alvo pareadas com embeddings de áudio zerados e, em seguida, estima parâmetros de blendshape para converter o vídeo de cabeça falante gerado em animação de fala 3D. Os autores também descrevem o AnyTalk_RT, uma versão destilada voltada a desempenho em tempo real.
⚡ Experimente hoje
Leia o paper antes de criar pipelines de sincronização labial específicos por personagem que exijam dados de animação ou rigging pesado.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Estudo mostra que contexto de auditoria e correção torna verificadores baseados em LLMs mais lenientes
O artigo no arXiv relata menos falsos alarmes após episódios anteriores de auditoria e correção no contexto do modelo.
AlphaEvolve ajuda a reduzir o limite da multiplicação de matrizes
Uma nova nota no arXiv relata um limite superior melhorado para o expoente da multiplicação de matrizes.
InternLM propõe a arquitetura de modelo Mobius
O artigo no arXiv separa memória e raciocínio para melhorar a compressão e a eficiência na inferência.