OpenVLA (Open Vision-Language-Action Model) คือโมเดล AI สำหรับหุ่นยนต์ที่ออกแบบให้รับ ภาพจากกล้อง + คำสั่งภาษาธรรมชาติ แล้วสร้าง Action สำหรับหุ่นยนต์ โดยตรง
งาน OpenVLA เผยแพร่ในปี 2024 โดยนำเสนอโมเดลแบบเปิดขนาดประมาณ 7 พันล้านพารามิเตอร์ ซึ่งฝึกจากข้อมูลการสาธิตการทำงานของหุ่นยนต์จำนวนมาก และออกแบบมาเพื่อเป็นโมเดลพื้นฐานสำหรับ Vision-Language-Action Robotics
ส่วนประกอบสำคัญของ OpenVLA
- ตัวเข้ารหัสภาพ (Visual Encoder): แปลงข้อมูลภาพที่หุ่นยนต์มองเห็นให้อยู่ในรูปที่ระบบเข้าใจ
- ตัวเชื่อม (Projector): ส่งต่อข้อมูลภาพไปยังโครงสร้างหลักของภาษา
- โมเดลภาษา Llama 2 (7B): ทำหน้าที่ประมวลผลคำสั่งและทำนายการกระทำของหุ่นยนต์
Types of VLA: 5 รูปแบบของ Vision-Language-Action Models
- Type-1 = [ LLM, Policy] ทำ การคิด/วางแผน ออกจาก การควบคุม Robot
- Type-2 = [ Generative Model, Visual Subgoal ]ใช้ Image/Video Generation Model เป็นส่วนหนึ่งของการวางแผน
- Type-3 = [ LLM, Generative Model, Policy ] LLM/VLM วางแผน + Generative Model สร้าง Intermediate Subgoal + Robot Policy ลงมือทำ
- Type-4 = VLA [ Perception, Planning, Control ] ทำตั้งแต่ Perception → Planning → Action แบบ End-to-End
- Type-5 = VLM [ Diffusion Policy, Robot Foundation Models ] ที่ใช้โมเดล Vision-Language เพื่อให้คำสั่งระดับสูง แล้วใช้ policy ที่เหมาะกับการควบคุมต่อ คิด แล้ว Diffusion Policy ลงมือ
- และ OpenVLA มีลักษณะใกล้ Type-4 มากที่สุด แต่สามารถนำไปประกอบเป็น Type-1/Agentic Hybrid Architecture ได้เมื่อวางไว้เป็น Action Model ใต้ AI Agent.
จุดเด่นหลัก
- ฝึกฝนด้วยชุดข้อมูลการเคลื่อนไหวหุ่นยนต์จำนวนมากจาก Open X-Embodiment
- เปิดให้ใช้งานและปรับแต่งได้ฟรีแบบโอเพนซอร์ส
- ช่วยให้หุ่นยนต์ปรับตัวเข้ากับสภาพแวดล้อมและงานที่หลากหลายได้ดีขึ้น
จุดแข็งของ OpenVLA
- Vision + Language + Action ไม่ได้เข้าใจเพียงข้อความ แต่เชื่อมข้อความเข้ากับการรับรู้และการกระทำ
- Generalization เป้าหมายของ VLA คือให้ Robot สามารถนำความรู้จาก Task หนึ่งไปใช้กับ Task อื่น ๆ ได้มากขึ้น
- Open Model เปิดให้ชุมชนนักวิจัยนำไปศึกษา ทดลอง และปรับแต่งได้ เหมาะกับ Robot Manipulation

ความคิดเห็น
แสดงความคิดเห็น