activity
20242026
collaborators
Showing 2026Show all

7 papers · 1 filter

cs.CL2026

Bulbul: A Dataset for Dialectal Arabic Speech Recognition

Ahmed Ashraf, Aisha Alansari, Fadel Al Abbas +30

Arabic automatic speech recognition (ASR) faces unique challenges due to diglossia, extensive regional dialect variation, and limited speech resources. Existing speech datasets oft…

cs.CL2026

LëtzCross: A Cross-Lingual Page-Level Benchmark for Multimodal Retrieval over Luxembourgish Documents

Omar El Bachyr, Fred Philippy, Laura Maria Bernardy +3

Recent page-image retrievers such as ColPali have improved retrieval over visually rich documents, yet little is known about how they behave in cross-lingual, low-resource settings…

cs.CL2026

Mawqif-XT: An Arabic Benchmark Dataset for Cross-Target Stance Detection

Rasha Albalawi, Nuha Albadi, Hamzah Luqman +4

Publicly available Arabic datasets for target-specific stance detection remain limited, particularly for evaluating cross-target generalization. This paper presents the Mawqif-XT,…

cs.RO2026

RAG-Based Auto-Configuration for Industrial Fieldbus Devices

Aadil Gani Ganie, Saad Ezzini, Naveed Farooz Marazi

Industrial device commissioning requires engineers to manually extract hundreds of protocol-specific parameters from heterogeneous PDF manuals and transcribe them into supervisory…

cs.SE2026

Empirical Study for Structured Output Control in LLMs for Software Engineering

Yewei Song, Prateek Rajput, Tiezhu Sun +3

LLM-generated outputs in software engineering rarely exist in isolation. They must plug into toolchains, APIs, and data pipelines that impose strict, often organization-specific st…

cs.AI2026

LeGo-Code: Can Modular Curriculum Learning Advance Complex Code Generation? Insights from Text-to-SQL

Salmane Chafik, Saad Ezzini, Ismail Berrada

Recently, code-oriented large language models (LLMs) have demonstrated strong capabilities in translating natural language into executable code. Text-to-SQL is a significant applic…