2 papers
cs.DB2018
Chasing Similarity: Distribution-aware Aggregation Scheduling (Extended Version)
Feilong Liu, Ario Salmasi, Spyros Blanas +1
Parallel aggregation is a ubiquitous operation in data analytics that is expressed as GROUP BY in SQL, reduce in Hadoop, or segment in TensorFlow. Parallel aggregation starts with…
cs.DB2018
To Ship or Not to (Function) Ship (Extended version)
Feilong Liu, Niranjan Kamat, Spyros Blanas +1
Sampling is often used to reduce query latency for interactive big data analytics. The established parallel data processing paradigm relies on function shipping, where a coordinato…