HelloWorld adiciona interações sociais a modelos de mundo em vídeo
O modelo de pesquisa permite que personagens na tela respondam a comandos do usuário, como acenar ou cumprimentar.
Por que importa
O trabalho mira uma lacuna nos modelos de mundo em vídeo: personagens capazes de responder socialmente aos usuários, em vez de apenas seguir movimentos ou prompts de cena pré-escritos. Ele também apresenta o HelloWorldBench, um benchmark para medir comportamentos de interação social nesses sistemas.
Pontos-chave
- 1.O HelloWorld permite respostas de personagens acionadas por botão em mundos em vídeo.
- 2.A autodestilação treina em clipes sintetizados com interações e movimento de câmera.
- 3.Um módulo sem treinamento localiza as respostas na janela em que o botão é pressionado.
Pesquisadores apresentaram o HelloWorld, um modelo de mundo em vídeo criado para permitir interação social entre usuários e personagens dentro de mundos em vídeo gerados. Com o pressionar de um botão, usuários podem fazer um personagem responder em direção à câmera, incluindo virar-se, acenar, balançar a cabeça afirmativamente ou dizer uma saudação curta. O sistema usa autodestilação em clipes sintetizados e um módulo de inferência sem treinamento que localiza a interação na janela do acionamento por meio de máscaras de atenção cruzada.
⚡ Experimente hoje
Leia o paper e o benchmark antes de projetar controles interativos de personagens para modelos de mundo em vídeo.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Google testa AMIE em consultas médicas por vídeo em tempo real
O sistema de pesquisa baseado no Gemini foi avaliado em consultas simuladas de telessaúde.
Modelo da Anthropic avança em trabalho sobre a hipótese de Riemann
Um modelo ainda não lançado da Anthropic fez avanços no problema matemático há muito tempo sem solução, segundo o TechCrunch.
IBM detalha método de memória de agentes ALTK-Evolve
O sistema recupera diretrizes específicas da tarefa para reduzir tokens de inferência em comparação com o ACE.