The Research Desk.

The most upvoted and starred AI research crossing the community today.

Last Brew Time: Jul 28, 2026, 10:54 AM PT

X.com Research Buzz

Vesuvius Challenge (AI reading of Herculaneum scrolls)
X.com
8974

Vesuvius Challenge (AI reading of Herculaneum scrolls)

Computer Vision
Qwen-Image-3.0
X.com
5477

Qwen-Image-3.0

Alibaba

NLP
Position: LLMs can't jump
X.com
4826

Position: LLMs can't jump

Tom Zahavy

Google DeepMind

AlphaXiv Trending

Kimi K3: Open Frontier Intelligence
AlphaXiv
220

Kimi K3: Open Frontier Intelligence

Kimi Team, Tongtong Bai, Yifan Bai

Claude Opus 5 System Card
AlphaXiv
169

Claude Opus 5 System Card

Anthropic

NLP
Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills
AlphaXiv
35

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

Siyuan Huang, Pengyu Cheng, Haotian Liu

Computer Vision
FilmBench: A Film-Grade Benchmark for Cinematic Video Generation
AlphaXiv
12

FilmBench: A Film-Grade Benchmark for Cinematic Video Generation

Shengyi Wang, Niantong Li, Guangzheng Hu

Alibaba Group, Moku Lab, Hujing Digital Media & Entertainment Group, Beijing Film Academy

Robotics
Data Pyramid for Embodied Manipulation
AlphaXiv
12

Data Pyramid for Embodied Manipulation

Yifan Ye, Yankai Fu, Yaoxu Lv

Computer Vision
Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
AlphaXiv
8

Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

Haopeng Li, Yitong Li, Junsong Chen

HuggingFace Daily Papers

Reinforcement Learning
A Vocabulary for Multi-Agent Automated Research Systems
HuggingFace
2

A Vocabulary for Multi-Agent Automated Research Systems

Bardiya Akhbari

NLP
TRACE: Business Rule-Grounded Reasoning Curriculum for Knowledge-Preserving Parametric Tool Retrieval in Enterprise LLMs
HuggingFace
2

TRACE: Business Rule-Grounded Reasoning Curriculum for Knowledge-Preserving Parametric Tool Retrieval in Enterprise LLMs

Sai Shruthi Sistla, Ashutosh Hathidara, Christopher Toukmaji, Mayank Shrivastava, Karthikeyan Asokkumar

SAP

NLP
UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models
HuggingFace
1

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati, Anestis Zaganidis, Yassine Ouali

Samsung Research

Characterizing Warp Divergence from Pascal to Blackwell
HuggingFace
1

Characterizing Warp Divergence from Pascal to Blackwell

Alpin Dale

Computer Vision
WorldDiT: A Unified Diffusion Architecture for World and Action Modeling
HuggingFace
0

WorldDiT: A Unified Diffusion Architecture for World and Action Modeling

Sen Wang, R. Gnana Praveen, Bidhan Roy, Marcos Villagra

Bagel Labs

Computer Vision
TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward
HuggingFace
0

TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward

Debottam Dutta, Jaehoon Hahm, Jianchong Chen, Romit Roy Choudhury