AAI News Hub

#multimodal

16 briefs tagged #multimodal.

Research

Researchers target VLM spatial reasoning gaps

New papers propose training, memory and benchmarks for multimodal spatial reasoning.

arXiv cs.AI+1 outlet·6d ago
Research

OmniScientist targets raw-evidence AI research workflows

The arXiv paper describes an omni-modal AI scientist for multidisciplinary research from raw evidence.

HF Daily Papers+1 outlet·6d ago
Research

Google tests AMIE for real-time medical video consultations

The Gemini-based research system was evaluated in simulated clinical video visits.

Google AI+1 outlet·Aug 12
Research

Ex-Omni-2D adds video presence to dialogue models

The arXiv paper describes a framework for coordinated text, speech and reference-conditioned video replies.

HF Daily Papers+1 outlet·Aug 11
Research

KVAE tokenizers target multimodal generative models

The arXiv report describes audio, image and video tokenizers for text-conditioned generation.

arXiv cs.LG+1 outlet·Aug 7
Research

New studies highlight VLM gaps in spatial reasoning

Recent papers test ways to measure and improve visual detail and global spatial awareness in VLMs.

arXiv cs.AI+1 outlet·Aug 6
Research

Researchers target more efficient visual reasoning

New papers propose latent, grounded and adaptive methods for multimodal question answering.

arXiv cs.AI+1 outlet·Aug 6
Research

Researchers target reasoning gaps in model post-training

New arXiv papers propose denser supervision for language and multimodal reasoning models.

arXiv cs.AI+1 outlet·Aug 5
Research

Researchers target weak spots in on-policy distillation

New arXiv papers propose OPD variants for multimodal, agent and generator training.

arXiv cs.LG+1 outlet·Aug 5
Research

SmartMage targets adaptive modality use in 3D scene understanding

The proposed MLLM routes visual and geometric inputs based on query relevance.

HF Daily Papers·Aug 5
Research

Paper maps design rules for multimodal pretraining

The arXiv study examines how language and vision interact during unified model training.

HF Daily Papers+1 outlet·Aug 5
Models

Mistral introduces Shieldstral for multimodal moderation

The 3B open-weights model targets moderation across text and images.

r/LocalLLaMA+1 outlet·Aug 5
Research

Researchers release UEmbed multimodal embeddings

UEmbed generates sparse lexical and dense representations in one decoder-only forward pass.

arXiv cs.AI+1 outlet·Aug 4
Research

Researchers propose DeepVoyager-VL for multimodal agents

The framework targets long-horizon search where visual evidence guides intermediate reasoning.

arXiv cs.AI+1 outlet·Aug 4
Research

SIGNPOST-Bench tests text-vision conflicts in MLLMs

The benchmark measures how multimodal models respond when scene text conflicts with visual evidence.

HF Daily Papers·Aug 4
Research

CAPEval Separates Caption Coverage From Precision

The benchmark tests how caption detail and factual reliability affect multimodal understanding and generation.

HF Daily Papers·Aug 3