YuE2 model nhạc 3B chạy trên card 24GB vừa vượt điểm Suno: chuyện gì đang xảy ra?


Nếu bạn theo dõi mảng AI tạo nhạc, chắc cũng từng nghĩ khoảng cách giữa mã nguồn mở và mấy ông lớn thu phí như Suno là rất xa. Nhưng đúng ngày 9/9/2026 — cũng là ngày Suno tung ra thế hệ v6 — nhóm nghiên cứu M-A-P âm thầm thả YuE2, một model nhạc mở chỉ khoảng 3-4 tỷ tham số, chạy được trên một card 24GB VRAM tại nhà. Và theo benchmark công bố, nó không chỉ chạy được mà còn vượt điểm cả dàn model thương mại.

YuE2 khác gì so với cách tạo nhạc AI thông thường

Điểm khiến YuE2 đáng chú ý không nằm ở việc nó “nghe hay hơn”, mà ở cách nó tạo ra bài hát. Thay vì đi thẳng từ văn bản ra âm thanh như phần lớn model tạo nhạc hiện nay, YuE2 đi theo hướng symbolic planning: nó viết ra một bản phối dưới dạng score ABC — gồm giai điệu và hợp âm — trước, rồi mới dựa vào bản phối đó để tổng hợp giọng hát và phần đệm. Toàn bộ pipeline chạy qua một kiến trúc kết hợp AR-NAR (Mixture-of-Transformers), sinh token ngữ nghĩa trước, rồi chuyển thành latent âm thanh qua flow matching, cuối cùng bộ giải mã VAE mới dựng ra file audio 48kHz.

Vì bản phối là một văn bản có thể đọc và sửa được, YuE2 có thêm khả năng mà các model tạo nhạc dạng “hộp đen” không có: chỉnh sửa theo phản hồi bằng lời. Bạn có thể nhờ agent chỉnh lại hòa âm, phát triển thêm một đoạn solo, hay đổi lời và phong cách cho một đoạn cụ thể, rồi YuE2 sẽ chỉ render lại đúng phần đó. Trong bản demo chính thức, đội ngũ M-A-P cho một bài hát đi qua 9 vòng chỉnh sửa với 14 phiên bản khác nhau — từ pop tiếng Trung chuyển thành nhạc jazz tiếng Anh với một đoạn solo saxophone. Cách làm này gợi nhớ đến làn sóng công cụ lập trình AI vài năm qua: khi output không còn là khối đen mà là một representation sửa được, cả tầng công cụ mới (editor, agent tự sửa theo phản hồi) mới có đất để mọc lên.

Về điểm benchmark: đúng là YuE2 dẫn đầu, nhưng cần biết rõ hơn

Theo bảng benchmark WildSongBench (192 prompt, so sánh trên 17 cấu hình khác nhau — không phải 15 như một số bài chia sẻ lan truyền), YuE2 ở chế độ best-of-8 đạt điểm trung bình SongBench 6.9632, cao hơn Suno v5 (6.8721). Đây là điểm quan trọng cần nói thêm: so với chính bản Suno v6 mới ra mắt cùng ngày, YuE2 còn bỏ xa hơn — Suno v6 chỉ đạt 6.5562 và biến thể v6 Wild đạt 6.4195 trên cùng bộ benchmark này.

Để dễ hình dung, đây là bảng so sánh điểm SongBench Avg trên cùng bộ 192 prompt của WildSongBench:

YuE2 model nhạc 3B chạy trên card 24GB vừa vượt điểm Suno: chuyện gì đang xảy ra? - 1
ModelSongBench Avg ↑Musicality ↑Ghi chú
YuE2 (best-of-8)6.96326.2666Mở, chạy được trên GPU 24GB
Suno v56.87215.9918Thương mại
Mureka 96.93776.0488Thương mại
Suno v66.55625.6558Ra mắt cùng ngày với YuE2
Suno v6 Wild6.41955.5644Biến thể “thử nghiệm” của v6

Lưu ý: khoảng cách giữa YuE2 và Mureka 9 chỉ khoảng 0,03 điểm — gần như ngang nhau chứ không phải bỏ xa. Trong khi đó, khoảng cách với Suno v6 lại lớn hơn nhiều, dù v6 là bản mới nhất của Suno.

Còn với các model thương mại khác, Mureka 9 đạt 6.9377 — vẫn thấp hơn YuE2 best-of-8 nhưng khoảng cách khá sít sao, chỉ chênh khoảng 0,03 điểm chứ không phải một khoảng cách rõ ràng. MiniMax Music (cả bản mở 3 lẫn bản thương mại 2.6) đều ở mức thấp hơn hẳn, quanh 6.28-6.32 điểm.

Một điều cũng đáng nhắc: các con số này là kết quả benchmark tự động theo giao thức riêng của nhóm nghiên cứu — chủ yếu đo độ “nhạc tính”, mức bám sát mô tả và tỷ lệ lỗi phát âm lời hát — nên nên xem là một thước đo tham khảo, không phải phán quyết cuối cùng về việc bài hát nào “hay hơn” theo cảm nhận người nghe.

Cấu hình phần cứng: chạy tại nhà có thực sự dễ không

Theo trang mô hình chính thức, YuE2 chạy được trên một GPU 24GB (kiểu RTX 4090), tạo ra một bài hát dài khoảng 3,6 phút chỉ trong hơn 70 giây, tối đa VRAM sử dụng chỉ khoảng 11GB. Yêu cầu hệ thống đi kèm là Linux, Python 3.10 trở lên và khoảng 24GB RAM máy.

Về quy mô model, trang Hugging Face xếp YuE2-3B vào nhóm kích thước 4 tỷ tham số theo cách phân loại chung của nền tảng — con số cụ thể như 3,59 tỷ tham số, 28 layer hay dung lượng file trọng số 7,3GB.

Lưu ý về giấy phép: trọng số YuE2 phát hành theo CC BY-NC 4.0, tức là chỉ dùng phi thương mại. Nếu bạn định đưa vào sản phẩm bán ra thị trường, phải đọc kỹ điều khoản trước — còn để học, làm demo, tự host cá nhân thì thoải mái.

Vậy điều này có ý nghĩa gì

Khi một model mở có thể chạy trên phần cứng cá nhân đã đạt điểm ngang, thậm chí vượt cả những cái tên thương mại tốn phí, câu chuyện dần chuyển từ “model nào mạnh hơn” sang “ai xây được tầng công cụ tốt hơn quanh model đó”. YuE2 tự thân nó đã minh họa điều này — phần khiến nó thú vị không chỉ là điểm benchmark, mà là việc bản phối có thể sửa tay hoặc sửa qua agent, mở ra một quy trình làm nhạc lặp đi lặp lại giống hệt vòng lặp sửa code, thay vì kiểu tạo lại từ đầu mỗi khi có chỗ chưa ưng như các model tạo nhạc truyền thống.

Cuộc đua sắp tới nhiều khả năng sẽ không chỉ nằm ở việc ai train được model nhạc tốt hơn, mà còn ở việc ai xây được editor, plugin, hay agent chỉnh sửa nhạc tốt nhất quanh những model mở kiểu này.


Previous

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *