AI research · Co-author
GameBoyWorlds
An embodied-AI benchmark evaluating frontier and open-source vision-language agents on grounding, navigation, planning, and continual self-improvement.
Co-author · under review at ICLR 2027
Up to 22%Task-success improvement from a curiosity-driven exploration pipeline on select environments
Problem
An embodied-AI benchmark evaluating agents on visual grounding, navigation, interaction, planning, and continual self-improvement.
Approach
- 500 multimodal tasks across 10 games.
- Evaluated frontier and open-source VLMs (GPT-5, Gemini, Claude, Gemma, Qwen) via hierarchical multimodal agents: supervisor-executor control, dynamic memory, self-reflection, subgoal planning.
- Curiosity-driven exploration pipeline distilling VLM insights into game-specific knowledge.
My role
Co-author.
Results
- Up to 22% task-success improvement on select environments (curiosity-driven exploration pipeline).
Stack
- Python
- PyTorch
- VLMs