Showing cs.CLShow all
2 papers · 1 filter
cs.CL2025
SearchInstruct: Enhancing Domain Adaptation via Retrieval-Based Instruction Dataset Creation
Iman Barati, Mostafa Amiri, Heshaam Faili
Supervised Fine-Tuning (SFT) is essential for training large language models (LLMs), significantly enhancing critical capabilities such as instruction following and in-context lear…
cs.CL2025
Matina: A Large-Scale 73B Token Persian Text Corpus
Sara Bourbour Hosseinbeigi, Fatemeh Taherinezhad, Heshaam Faili +3
Text corpora are essential for training models used in tasks like summarization, translation, and large language models (LLMs). While various efforts have been made to collect mono…