คู่มือนี้สรุปขั้นตอนการติดตั้งและรันโมเดลภาษาขนาดเล็กบน Mac mini M4 (RAM 16GB) ด้วยเฟรมเวิร์ก MLX ของ Apple ซึ่งทำงานได้อย่างรวดเร็วและใช้หน่วยความจำคุ้มค่า โดยทดสอบทั้งโมเดล 4-bit และ 1-bit
1. เตรียมสภาพแวดล้อม (Environment Setup)
เปิด Terminal และรันคำสั่งเหล่านี้เพื่อสร้างและเปิดใช้งาน Virtual Environment:
mkdir -p ~/mlx-1bit
cd ~/mlx-1bit
python3 -m venv .venv
source .venv/bin/activate
2. ติดตั้งไลบรารี MLX
ติดตั้งไลบรารี MLX สำหรับรันโมเดล AI บน Apple Silicon:
pip install -U mlx mlx-lm
3. ทดสอบรันโมเดล
ทดสอบรันโมเดลขนาดเล็ก (เช่น Llama 3.2 1B Instruct แบบ 4-bit) เพื่อให้ดาวน์โหลดเร็วและทำงานได้ทันที:
python -m mlx_lm.generate --model mlx-community/Llama-3.2-1B-Instruct-4bit --prompt "Name three planets in our solar system."
4. วิธีล้างแคชโมเดลเมื่อต้องการเคลียร์พื้นที่
หากต้องการลบโมเดลที่เคยดาวน์โหลดไว้ทั้งหมดเพื่อประหยัดพื้นที่ดิสก์ ให้ใช้คำสั่งนี้:
rm -rf ~/.cache/huggingface/hub/models--*
5. ถ้าต้องการทดสอบแบบ Chat ให้ใช้คำสั่งนี้
python -m mlx_lm.chat --model mlx-community/Llama-3.2-1B-Instruct-4bit
หรือสามารถใช้โปรแกรม LM Studio ในการทดสอบแบบ GUI ได้
Python ให้ใช้เวอร์ชั่น 3.11 เพื่อให้มีปัญหาในการทดสอบน้อยที่สุด (สามารถใช้ผ่าน pyenv เพื่อความสะดวกได้)

ทดสอบใช้งาน 1-bit LLM
python -m mlx_lm.chat --model mlx-community/Falcon3-1B-Instruct-1.58bit
หรือ
python -m mlx_lm.chat --model mlx-community/bitnet-b1.58-2B-4T
หรือหากอยากจะทดสอบกับ 8B parameters
python -m mlx_lm.chat --model prism-ml/Ternary-Bonsai-8B-mlx-2bit
หรือจะทดสอบใน LM Studio ก็ได้ครับ
บทความที่เกี่ยวข้อง รู้จักกับ 1-bit LLM