ข้ามไปที่เนื้อหาหลัก

บทความ

กำลังแสดงโพสต์ที่มีป้ายกำกับ Data Engineering

Apache Atlas แนวคิด ความหมาย องค์ประกอบ การพัฒนา และการนำไปใช้งาน

บทนำและที่มาของ Apache Atlas  แนวคิดและที่มาของปัญหา ที่นำไปสู่การพัฒนา Apache Atlas เกิดขึ้นจากความท้าทายในยุค Big Data โดยเฉพาะเมื่อองค์กรต่างๆ เริ่มเปลี่ยนมาใช้งาน Apache Hadoop และระบบ Data Lake กันมากขึ้น ซึ่งทำให้เกิดปัญหาหลักๆ ดังนี้ ภาวะ "Data Swamp" (หนองน้ำข้อมูล) เมื่อการเก็บข้อมูลทำได้ง่ายและถูกลง องค์กรจึงสาดข้อมูลทุกอย่างลง Data Lake จนไม่รู้ว่าใครเอาอะไรมาเก็บไว้บ้าง ข้อมูลไหนเก่า ข้อมูลไหนซ้ำซ้อน จนระบายข้อมูลมาใช้งานไม่ได้ ดังนั้นจึงควรมีระบบที่สามารถระบุ ติดตาม เก็บประวัติการจัดเก็บข้อมูลต่างๆ อย่างเป็นระบบ ระเบียบมากขึ้น สถาปัตยกรรมข้อมูลที่ซับซ้อนเกินไป ข้อมูลไหลผ่านเครื่องมือหลายตัวมาก เช่น เข้ามาทาง Kafka ถูกประมวลผลด้วย Spark แล้วนำไปเก็บใน Hive จากนั้นส่งต่อไปทำรายงานบน BI พอข้อมูลปลายทางผิดพลาด ทีมงานไม่สามารถไล่เช็กได้เลยว่าข้อมูลพังที่ขั้นตอนไหน ให้ในการตรวจสอบที่มาของข้อมูลที่ผ่านมาของข้อมูลนั้นที่นำไปใช้ กฎหมายและการควบคุมความปลอดภัย (Compliance & Security) การมาของกฎหมายคุ้มครองข้อมูลส่วนบุคคล (เช่น GDPR, PDPA) บังคับให้องค์กรต้องรู้ว่าข้อมูล...

Airbyte คืออะไร จุดเด่น แนวคิด เครื่องมือที่ใช้ รองรับงาน Big Data

Airbyte คือ แพลตฟอร์มการบูรณาการข้อมูล (Data Integration) แบบโอเพนซอร์ส (Open-source) โดยการสร้าง Data Pipelines และ replicate  ในระบบที่ใช้งานสูง น์แบบ ELT (Extract, Load, Transform) เพื่อดึงข้อมูลจากแหล่งต่าง ๆ มารวมไว้ที่ปลายทางเดียวกัน เช่น คลังข้อมูล (Data Warehouse) โดยช่วยลดเวลาและภาระงานเขียนโค้ดของ Data Engineer ได้อย่างมาก จุดเด่นสำคัญของ Airbyte ตัวเชื่อมต่อจำนวนมาก (Connectors): มีตัวเชื่อมต่อสำเร็จรูปมากกว่า 300–600 ตัว รองรับแหล่งข้อมูลหลากหลาย เช่น ฐานข้อมูล, API, ไฟล์ หรือแอปพลิเคชันธุรกิจ (เช่น Salesforce, Google Sheets, PostgreSQL) ประหยัดเวลา (No-Code/Low-Code): มีหน้าจอ UI ที่ใช้งานง่าย และเครื่องมือสร้างตัวเชื่อมต่อแบบไม่ต้องเขียนโค้ด (Connector Builder)   ความยืดหยุ่นในการติดตั้ง: สามารถเลือกใช้งานได้ทั้งแบบโฮสต์เองบนระบบขององค์กร (Self-managed) หรือแบบคลาวด์สำเร็จรูป (Cloud)   ทำงานร่วมกับเครื่องมืออื่นได้ดี: มักใช้งานร่วมกับเครื่องมือแปลงข้อมูลอย่าง dbt (data build tool) เพื่อทำขั้นตอนการแปลงข้อมูล (Transform) ให้สมบูรณ์ยิ่งขึ้น Airbyte สร้างข...

Apache Spark คืออะไร จุดเด่น องค์ประกอบ

Apache Spark คืออะไร  Apache Spark คือระบบประมวลผลข้อมูลแบบกระจาย (Distributed Processing System) แบบโอเพนซอร์ส ที่ออกแบบมาสำหรับงาน Big Data โดยเฉพาะ โดดเด่นเรื่อง ความเร็วสูงเพราะใช้หน่วยความจำหลัก (In-memory Processing)  รองรับการใช้งานใน ภาษาระดับสูง ได้แก่ Java, Scala, Python และ R และได้รับการปรับแต่งมาเพื่อรองรับการประมวลผลทั่วไป นอกจากนี้ยังรองรับเครื่องมือระดับสูงมากมาย เช่น Spark SQLสำหรับการประมวลผล SQL และข้อมูลที่มีโครงสร้าง, pandas API บน Spark สำหรับเวิร์กโหลด pandas, MLlib สำหรับการเรียนรู้ของเครื่อง, GraphX ​​สำหรับการประมวลผลกราฟ และ Structured Streaming สำหรับการคำนวณแบบ bacth และการประมวลผลสตรีม Real-time Streaming  จุดเด่นหลักของ Apache Spark ประมวลผลเร็วมาก: เร็วกว่าระบบเก่าอย่าง Hadoop MapReduce บนดิสก์สูงสุดถึง 100 เท่า รองรับงานหลากหลาย: ทำงานได้ทั้งแบบแบตช์ (Batch Processing), สตรีมมิ่งแบบเรียลไทม์ (Real-time Streaming), แมชชีนเลิร์นนิง (MLlib) และวิเคราะห์กราฟ ใช้งานง่าย: มี API รองรับหลายภาษา เช่น Python (PySpark), SQL, Scala และ Java องค์ปร...