OpenVLA คือ โมเดลปัญญาประดิษฐ์ประเภทวิสัยทัศน์-ภาษา-การกระทำ (Vision-Language-Action หรือ VLA) แบบโอเพนซอร์สขนาด 7 พันล้านพารามิเตอร์ ที่พัฒนาขึ้นเพื่อควบคุมหุ่นยนต์ ให้เข้าใจภาพที่มองเห็น คำสั่งภาษามนุษย์ และแปลออกมาเป็นการเคลื่อนไหวหรือการกระทำ ได้อย่างแม่นยำ OpenVLA (Open Vision-Language-Action Model) คือโมเดล AI สำหรับหุ่นยนต์ที่ออกแบบให้รับ ภาพจากกล้อง + คำสั่งภาษาธรรมชาติ แล้วสร้าง Action สำหรับหุ่นยนต์ โดยตรง งาน OpenVLA เผยแพร่ในปี 2024 โดยนำเสนอโมเดลแบบเปิดขนาดประมาณ 7 พันล้านพารามิเตอร์ ซึ่งฝึกจากข้อมูลการสาธิตการทำงานของหุ่นยนต์จำนวนมาก และออกแบบมาเพื่อเป็นโมเดลพื้นฐานสำหรับ Vision-Language-Action Robotics ส่วนประกอบสำคัญของ OpenVLA ตัวเข้ารหัสภาพ (Visual Encoder): แปลงข้อมูลภาพที่หุ่นยนต์มองเห็นให้อยู่ในรูปที่ระบบเข้าใจ ตัวเชื่อม (Projector): ส่งต่อข้อมูลภาพไปยังโครงสร้างหลักของภาษา โมเดลภาษา Llama 2 (7B): ทำหน้าที่ประมวลผลคำสั่งและทำนายการกระทำของหุ่นยนต์ Types of VLA: 5 รูปแบบของ Vision-Language-Action Models Type-1 = [ LLM, Policy] ทำ การคิด/วางแผน ออกจาก การค...
บอกกล่าว เล่าเทคโนโลยี ชงกาแฟ นั่งอ่าน