ข้ามไปที่เนื้อหาหลัก

วิธีรัน LLM บน GPU เครื่องเดียว (Local AI Server) แบบที่นักพัฒนาใช้จริง เพื่อสร้าง AI Chatbot ส่วนตัวเหมือน ChatGPT แต่รันบนเครื่องตัวเอง

 ต่อไปนี้คือ วิธีรัน LLM บน GPU เครื่องเดียว (Local AI Server) แบบที่นักพัฒนาใช้จริง เพื่อสร้าง AI Chatbot ส่วนตัวเหมือน ChatGPT แต่รันบนเครื่องตัวเอง


ผมจะอธิบายตั้งแต่ Hardware → Software → Installation → Run Model



1. Hardware สำหรับ Local LLM



GPU สำคัญที่สุด

GPU

VRAM

ขนาด LLM ที่รันได้

NVIDIA RTX 3060

12GB

7B (quantized)

NVIDIA RTX 3090

24GB

13B

NVIDIA RTX 4090

24GB

30B (quantized)

CPU

8 – 16 cores

RAM

32 GB recommended

Storage

SSD 1TB





2. Software Stack



Stack ของ Local LLM

User Interface

     ↓

LLM Runtime

     ↓

Model

     ↓

CUDA

     ↓

GPU

เครื่องมือที่นิยม



Runtime



  • Ollama
  • LM Studio
  • vLLM




Framework



  • PyTorch






3. LLM Open Source ที่เหมาะกับ Local



โมเดลที่นิยม

Model

Size

LLaMA 3

8B

Mistral 7B

7B

TinyLlama

1.1B





4. วิธีติดตั้ง Ollama (ง่ายที่สุด)


Step 1

ติดตั้ง

https://ollama.com

หรือ

brew install ollama





Step 2

รัน server

ollama serve



Step 3



ดาวน์โหลดโมเดล


ตัวอย่าง

ollama run llama3



5. ตัวอย่าง Chat กับ LLM


ollama run llama3

แล้วพิมพ์

Explain artificial intelligence

โมเดลจะตอบทันที





6. ใช้ Python เชื่อม LLM



ตัวอย่างโค้ด

import requests


response = requests.post(

"http://localhost:11434/api/generate",

json={

"model":"llama3",

"prompt":"Explain machine learning"

})


print(response.json())





7. Quantization (สำคัญมาก)



เพื่อลด VRAM

FP16

INT8

INT4

ตัวอย่าง

Model

VRAM

7B FP16

14GB

7B INT4

4GB



8. Interface สำหรับ Local AI


UI ที่นิยม


  • Open WebUI
  • Text Generation WebUI



หน้าตาจะเหมือน


  • ChatGPT






9. Local AI Server Architecture


User

 ↓

Web Interface

 ↓

LLM API

 ↓

Model Runtime

 ↓

GPU





10. ความเร็วตัวอย่าง (RTX 4090)


Model

Speed

7B

80 tokens/s

13B

50 tokens/s

30B

20 tokens/s





11. ระบบ RAG เพิ่มความรู้



ถ้าต้องการให้ AI อ่านเอกสาร


ต้องใช้

RAG

Retrieval Augmented Generation

Stack

Documents

 ↓

Embeddings

 ↓

Vector Database

 ↓

LLM

Vector DB เช่น


  • Chroma
  • Pinecone






12. ระบบ AI Agent



Local LLM สามารถทำ

AI assistant

Coding AI

Document AI

Chatbot

Automation

เหมือน


  • Claude
  • Gemini






13. Cost สร้าง Local AI Server



ตัวอย่าง

อุปกรณ์

ราคา

RTX 4090

~$1600

CPU

~$400

RAM

~$150

SSD

~$100

รวม

≈ $2000





สรุป



Local LLM ต้องมี

GPU

Open Source Model

LLM Runtime

Interface

จะได้ AI server ส่วนตัว





ความคิดเห็น

โพสต์ยอดนิยมจากบล็อกนี้

Anvil แฟลต์ฟอร์ม สำหรับ Python Full Stack มีครบ จบในเครื่องมือเดียว

Anvil แฟลต์ฟอร์ม สำหรับ Python Full Stack มีครบ จบในเครื่องมือเดียว Avil เป็นแฟลต์ฟอร์มสำหรับสร้างเว็บแอพลิเคชั่น ด้วยภาษา python สามารถใช้งานทั้ง HTML CSS JavaScript SQL ทั้งหมดนี้รวมในเครื่องมือที่ชื่อว่า Anvil Python ใช้สำหรับรันบนบราวเซอร์ เซอร์เวิรส์ และสร้าง UI ด้วยวิธีการ Drag-and-Drop เพียงลากวาง UK และยังสามารถเชื่อมต่อและใช้งาน Database  และยังสามารถ Integration กับแฟลต์ฟอร์มอื่นๆ ได้อีกด้วย โครงสร้างของ Anvil  การออกแบบง่ายๆ ด้วย drag-and-drop ใช้ python เป็น client-side และรันบน บราวเซอร์ Server-side รันบน Anvil Server สามารถใช้ Database ต่างๆ เพื่อเก็บข้อมูล สามารถรัน python บนเครื่องและตอบโต้กับแอปพลิเคขั่นไดด้

อะไรคือ NPU (Neural Processing Unit) มีความสำคัญอย่างไร แนวคิดมาจากไหน

ความหมาของคำว่า NPU (Neural Processing Unit)  NPU (Neural Processing Unit) คือ หน่วยประมวลผลโครงข่ายประสาทที่สร้างมาเพื่อใช้งานด้านปัญญาประดิษฐ์ เป็นหน่วยประมวลผลพิเศษที่ออกแบบมาเพื่อใช้ในแนวคิดของการเรียนรู้ของเครื่อง (Machine Learning) ของคอมพิวเตอร์โดยเฉพาะ ทำให้การประมวลผล AI ทรงประสิทธิภาพเพิ่มขึ้นจากเดิมของ TPU GPU และ CPU เช่น การจดจำภาพ, วิเคราะห์เสียง, หรือการแปลภาษา ทำได้รวดเร็วและประหยัดพลังงานกว่า CPU/GPU ทั่วไป โดยทำงานคล้ายโครงข่ายประสาทของมนุษย์ และพบได้ทั้งในสมาร์ตโฟน, คอมพิวเตอร์ (PC), และอุปกรณ์ AI อื่นๆ ในอนาคต เพื่อเร่งความเร็วของการทำงานของ AI สามารถจัดการงานและปัญหาที่ซับซ้อนได้อย่างมีประสิทธิภาพ  ประวัติความเป็นมาของ NPU (Neural Processing Unit)  ตั้งแต่ปี 1970 เป็นต้นมาเราได้ใช้เริ่มมีการใช้หน่วยการประมวลผลแบบดั้งเดิม คือ หน่วยประมวลผลกลาง (CPU) ถือเป็น "สมอง" และเป็นกลไกการทำงานของคอมพิวเตอร์ ดังนั้นซีพียู CPU ประมวลผลงานคำนวณแบบดั้งเดิมส่วนใหญ่มีหน้าที่รับผิดชอบการทำงานของแอปพลิเคชันให้มีศักยภาพหลากหลายเพิ่มมาเรื่อย แม้ว่าจะมีหลายประเภท แต่โดยทั่...

TomCat สำหรับติดตั้ง แก้ไข คอนฟิก ใช้งาน JSP

Apache Tomcat เป็น  HTTP Server ที่มีความสามารถนำภาษาจาวามาใช้งานได้  สามารถใช้เทคโนโลยีของภาษาจาวาที่เรียกว่า Java Servlet  และ Java Server Page (JSP)  Tomcat เป็นโปรแกรม Open-Source  อยู่ภายใต้การดูแลของ Apache Software Foundation  (ซึ่งเป็นผู้สร้าง Apache HTTP Server ที่เป็นที่นิยมใช้กันอย่างแพร่หลาย)  สามารถอ่านรายละเอียดของ Tomcat ได้ที่  http://tomcat.apache.org  โดยเลือกหัวข้อ “ Documentation”  และเลือก “Tomcat 7.0” ขั้นตอนการติดตั้ง Tomcat เรียงลำดับดังนี้