activity
20242026
collaborators
Showing cs.AIShow all

6 papers · 1 filter

cs.AI2026

SLR: Automated Synthesis for Scalable Logical Reasoning

Lukas Helff, Ahmad Omar, Felix Friedrich +7

We introduce SLR, an end-to-end framework for systematic evaluation and training of Large Language Models (LLMs) via Scalable Logical Reasoning. Given a user's task specification,…

cs.AI2026

SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems

Hikaru Shindo, Hanzhao Lin, Lukas Helff +2

As Large Language Models (LLMs) transition from text processors to autonomous agents, evaluating their social reasoning in embodied multi-agent settings becomes critical. We introd…

cs.AI2026

Fodor and Pylyshyn's Legacy: Still No Human-like Systematic Compositionality in Neural Networks

Tim Woydt, Moritz Willig, Antonia Wüst +4

Strong meta-learning capabilities for systematic compositionality are emerging as an important skill for navigating the complex and changing tasks of today's world. However, in pre…

cs.AI2025

Synthesizing Visual Concepts as Vision-Language Programs

Antonia Wüst, Wolfgang Stammer, Hikaru Shindo +3

Vision-Language models (VLMs) achieve strong performance on multimodal tasks but often fail at systematic visual reasoning tasks, leading to inconsistent or illogical outputs. Neur…

cs.AI2025

Bongard in Wonderland: Visual Puzzles that Still Make AI Go Mad?

Antonia Wüst, Tim Woydt, Lukas Helff +5

Recently, newly developed Vision-Language Models (VLMs), such as OpenAI's o1, have emerged, seemingly demonstrating advanced reasoning capabilities across text and image modalities…

cs.AI2024

V-LoL: A Diagnostic Dataset for Visual Logical Learning

Lukas Helff, Wolfgang Stammer, Hikaru Shindo +2

Despite the successes of recent developments in visual AI, different shortcomings still exist; from missing exact logical reasoning, to abstract generalization abilities, to unders…