AI research · Co-author

GameBoyWorlds

An embodied-AI benchmark evaluating frontier and open-source vision-language agents on grounding, navigation, planning, and continual self-improvement.

Co-author · under review at ICLR 2027

Up to 22%Task-success improvement from a curiosity-driven exploration pipeline on select environments

Problem

An embodied-AI benchmark evaluating agents on visual grounding, navigation, interaction, planning, and continual self-improvement.

Approach

  • 500 multimodal tasks across 10 games.
  • Evaluated frontier and open-source VLMs (GPT-5, Gemini, Claude, Gemma, Qwen) via hierarchical multimodal agents: supervisor-executor control, dynamic memory, self-reflection, subgoal planning.
  • Curiosity-driven exploration pipeline distilling VLM insights into game-specific knowledge.

My role

Co-author.

Results

  • Up to 22% task-success improvement on select environments (curiosity-driven exploration pipeline).

Stack

  • Python
  • PyTorch
  • VLMs