- รับลิงก์
- X
- อีเมล
- แอปอื่นๆ
Apache Spark คืออะไร Apache Spark คือระบบประมวลผลข้อมูลแบบกระจาย (Distributed Processing System) แบบโอเพนซอร์ส ที่ออกแบบมาสำหรับงาน Big Data โดยเฉพาะ โดดเด่นเรื่อง ความเร็วสูงเพราะใช้หน่วยความจำหลัก (In-memory Processing) รองรับการใช้งานใน ภาษาระดับสูง ได้แก่ Java, Scala, Python และ R และได้รับการปรับแต่งมาเพื่อรองรับการประมวลผลทั่วไป นอกจากนี้ยังรองรับเครื่องมือระดับสูงมากมาย เช่น Spark SQLสำหรับการประมวลผล SQL และข้อมูลที่มีโครงสร้าง, pandas API บน Spark สำหรับเวิร์กโหลด pandas, MLlib สำหรับการเรียนรู้ของเครื่อง, GraphX สำหรับการประมวลผลกราฟ และ Structured Streaming สำหรับการคำนวณแบบ bacth และการประมวลผลสตรีม Real-time Streaming จุดเด่นหลักของ Apache Spark ประมวลผลเร็วมาก: เร็วกว่าระบบเก่าอย่าง Hadoop MapReduce บนดิสก์สูงสุดถึง 100 เท่า รองรับงานหลากหลาย: ทำงานได้ทั้งแบบแบตช์ (Batch Processing), สตรีมมิ่งแบบเรียลไทม์ (Real-time Streaming), แมชชีนเลิร์นนิง (MLlib) และวิเคราะห์กราฟ ใช้งานง่าย: มี API รองรับหลายภาษา เช่น Python (PySpark), SQL, Scala และ Java องค์ปร...