ข้ามไปที่เนื้อหาหลัก

บทความ

กำลังแสดงโพสต์ที่มีป้ายกำกับ VLM

MiniCPM-o 4.5: AI ที่มองเห็น ฟัง และพูดได้พร้อมกัน

1. MiniCPM-o 4.5 คืออะไร? MiniCPM-o 4.5 เป็นโมเดล Multimodal AI ที่รวมความสามารถหลายด้านไว้ในระบบเดียว ได้แก่ 👁️ Vision — มองเห็นภาพและวิดีโอ 👂 Audio — รับฟังเสียง 🧠 Language — วิเคราะห์และให้เหตุผล 🗣️ Speech — สร้างเสียงพูด 🔄 Full-Duplex — รับ Input และสร้าง Output พร้อมกัน ⚡ Streaming — ทำงานต่อเนื่องแบบ Real-time คำว่า Omni จึงมีความสำคัญ เพราะโมเดลไม่ได้ออกแบบมาให้ทำงานเฉพาะ Text หรือ Image แต่สามารถประมวลผลหลาย Modalities ภายใน Workflow เดียวกัน จุดน่าสนใจคือ MiniCPM-o 4.5 มีขนาดประมาณ 9B Parameters ซึ่งเล็กกว่าโมเดล Multimodal ขนาดใหญ่หลายตัว ทำให้แนวคิดการนำไปใช้งานบน Hardware ระดับ Consumer มีความน่าสนใจมากขึ้น ( LearnOpenCV ) 2. ปัญหาของ AI แบบเดิม AI Multimodal ส่วนใหญ่ทำงานในลักษณะ Turn-Based Interaction ตัวอย่างเช่น User ↓ ส่งภาพ/วิดีโอ ↓ AI ประมวลผล ↓ AI ตอบ ↓ User ถามใหม่ ระบบลักษณะนี้เหมาะกับ Chatbot แต่ไม่เหมาะกับสถานการณ์ที่ข้อมูลเปลี่ยนแปลงตลอดเวลา เช่น การถ่ายทอดสดกีฬา กล้อง Surveillance หุ่นยนต์ ผู้ช่วย AI แบบ Real-time ระบบช่วยเหลือผู้พิการ AI Tutor ...

VLM (Vision-Language Model) คืออะไร

VLM (Vision-Language Model) คืออะไร  VLM (Vision-Language Model) คือโมเดลปัญญาประดิษฐ์ที่สามารถ เข้าใจทั้งภาพ (Vision) และภาษา (Language) พร้อมกันได้ในระบบเดียว ซึ่งเข้าใจง่ายๆ VLM สามารถแปลงภาพเป็นภาษา และภาษาเป็นภาพได้  หลักคิดคือ Computer Vision + Natural Language Processing (NLP) ความสมารถของ VLM  อธิบายภาพ (Image Captioning)  เมื่อเราใส่ภาพแล้วให้  AI บรรยายออกมาเป็นข้อความ ตัวอย่าง  Clip ถาม-ตอบเกี่ยวกับภาพ (Visual Q&A)  ค้นหาในภาพหรือกล้องได้ วิเคราะห์เนื้อหาในภาพ  สามารถตรวจจับวัตถุ (Object Detection) และอ่านตัวอักษรในภาพ (OCR) GPT-4V เชื่อมภาพกับคำสั่ง (Multimodal Reasoning) การนำไปใช้งานจริง Smart Home (กล้อง + AI เข้าใจเหตุการณ์) Medical AI (วิเคราะห์ภาพ X-ray) Self-driving car ระบบความปลอดภัย (CCTV AI) E-commerce (ค้นหาสินค้าจากภาพ)