Thinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMs
arXiv:2603.
Pourquoi c'est important
Tracked across 4 sources; see linked reporting for full context.
Points clés
- 1.arXiv:2603.
- 2.06697v2 Announce Type: replace-cross Abstract: Vision--language models (VLMs) process images as visual tokens, yet their intermediate reasoning is often carried out in text, which can be suboptimal for visually grounded radiology tasks.
arXiv:2603. 06697v2 Announce Type: replace-cross Abstract: Vision--language models (VLMs) process images as visual tokens, yet their intermediate reasoning is often carried out in text, which can be suboptimal for visually grounded radiology tasks. Radiologists instead diagnose via sequential visual search; eye-tracking captures this process as time-ordered gaze trajectories that reveal how evidence is acquired over time.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIThinking with Gaze: Sequential Eye-Tracking as Visual Reasoning Supervision for Medical VLMsAug 18, 12:00 PM↗
- arXiv cs.AIBeyond Visual CoT: Internalized Visual Thinking for Proactive Video ReasoningAug 18, 12:00 PM↗
- arXiv cs.LGBeyond Visual CoT: Internalized Visual Thinking for Proactive Video ReasoningAug 18, 12:00 PM↗
- HF Daily PapersBeyond Visual CoT: Internalized Visual Thinking for Proactive Video ReasoningAug 16, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Business
Perplexity gagne des millions d’utilisateurs en Inde
Une offre gratuite d’Airtel a dopé la base d’utilisateurs de Perplexity en Inde, tandis que les revenus ont progressé après la fin des nouvelles inscriptions.
TRACE-Bench cible la génération d’images à références multiples
Ce benchmark décompose les prompts en quatre opérateurs afin de diagnostiquer les défaillances des modèles.
Flow Motion Policy : planification de mouvement pour manipulateurs avec des modèles de flow matching
arXiv:2604.