10 Paper AI Hot nhất trên Hugging Face hôm nay: Video thời gian thực, agent dài hạn, robot có trí nhớ và hơn thế nữa
Hôm nay, bảng xếp hạng paper trên Hugging Face cho thấy một bức tranh rất rõ: AI đang dịch chuyển mạnh theo 4 hướng lớn — video generation, agent dài hạn, robot foundation model, và đánh giá lại năng lực “hiểu” của mô hình. Dưới đây là bản tổng hợp 10 paper được upvote cao nhất, tập trung vào 4 câu hỏi cho mỗi bài:
- Bài toán
- Ý tưởng
- Điểm mới
- Ứng dụng thực tế
1) Vidu S1: A Real-Time Interactive Video Generation Model
Paper:2607.03118
GitHub:
Bài toán
Phần lớn mô hình sinh video hiện nay vẫn gặp giới hạn lớn về độ trễ, độ dài video, và chi phí phần cứng. Tạo video mượt, tương tác được theo thời gian thực trên GPU phổ thông vẫn là bài toán khó.
Ý tưởng
Vidu S1 hướng tới một hệ thống sinh video real-time interactive, cho phép điều khiển nhân vật số bằng giọng nói, tạo video tốc độ khung hình cao và có thể kéo dài gần như vô hạn.
Điểm mới
Điểm đáng chú ý nằm ở định hướng hệ thống nhiều hơn là chỉ kiến trúc mô hình: paper nhấn mạnh khả năng chạy trên consumer GPUs, dùng các kỹ thuật như TurboDiffusion và TurboServe để giảm độ trễ. Đây là bước chuyển từ “demo nghiên cứu” sang “sản phẩm có thể dùng”.
Ứng dụng thực tế
- VTuber/nhân vật ảo điều khiển bằng giọng nói
- Livestream AI avatar
- Trợ lý số có biểu cảm và cử động thời gian thực
- Sản xuất nội dung video tương tác chi phí thấp
Nhận định: Nếu kết quả thực nghiệm đủ mạnh, đây có thể là một trong những paper quan trọng nhất ở mảng real-time generative media.
2) ABot-N1: Toward a General Visual Language Navigation Foundation Model
Paper:2607.10383
Project:
Project:
Project:
Bài toán
RL cho mô hình lớn rất đắt. Câu hỏi là: liệu có thể dùng một mô hình nhỏ hơn làm “người đi trước”, học bằng RL trước, rồi truyền lợi ích đó sang mô hình lớn mà không cần chạy RL lại từ đầu?
Ý tưởng
Paper đề xuất Direct On-Policy Distillation (OPD). Thay vì chỉ distill output thông thường, phương pháp tận dụng policy shift do RL tạo ra như một dạng tín hiệu thưởng ngầm, rồi chuyển hóa cải thiện đó sang mô hình lớn hơn.
Điểm mới
Khía cạnh mới là tư duy weak-to-strong transfer trong giai đoạn hậu huấn luyện bằng RL. Nói đơn giản: cho model nhỏ “học khó trước”, rồi chuyển quỹ đạo hành vi tốt sang model lớn rẻ hơn nhiều so với RL toàn phần trên model lớn.
Ứng dụng thực tế
- Giảm chi phí RLHF/RLAIF/RLVR
- Tăng tốc huấn luyện mô hình reasoning lớn
- Chuyển năng lực từ model thử nghiệm sang model sản phẩm
- Tối ưu pipeline alignment ở quy mô công nghiệp
Nhận định: Đây là hướng rất thực dụng. Trong bối cảnh chi phí RL ngày càng cao, mọi kỹ thuật “distill thay vì retrain” đều cực kỳ giá trị.
7) Video Generation Models are General-Purpose Vision Learners
Paper:2607.09024
Project:
Project:
Bài toán
Tái dựng 4D human-scene — tức con người + cảnh theo thời gian — thường yêu cầu nhiều camera với góc nhìn chồng lắp tốt. Nhưng trong thực tế, dữ liệu thu được thường có low overlap, khó tái dựng ổn định.
Ý tưởng
Paper tập trung giải bài toán tái dựng động từ dữ liệu capture ít chồng lắp hơn bình thường. Mục tiêu là phục hồi đồng thời hình học, chuyển động, và tương tác người-cảnh theo thời gian.
Điểm mới
Điểm mới là xử lý một setting rất thực tế nhưng khó: multi-view không lý tưởng. Đây là khác biệt lớn so với nhiều hệ thống chỉ hoạt động tốt trong studio được kiểm soát chặt.
Ứng dụng thực tế
- Làm phim, game, XR/VR
- Motion capture rẻ hơn cho studio nhỏ
- Digital human và telepresence
- Phân tích chuyển động người trong không gian thật
Nhận định: Nếu robust trong điều kiện capture nghèo, công nghệ này sẽ rất hữu ích cho ngành sáng tạo nội dung 3D.
Kết luận: 4 xu hướng nổi bật từ top paper hôm nay
Nhìn toàn bộ danh sách, có thể rút ra 4 xu hướng lớn:
1. Video đang trở thành trung tâm
Từ Vidu S1, Video-Oasis, đến Video Generation Models are General-Purpose Vision Learners, video không còn chỉ là bài toán tạo nội dung mà đang trở thành nền tảng để học perception, reasoning và đánh giá mô hình.
2. Agent cần dài hạn hơn, thực tế hơn
Long-Horizon-Terminal-Bench và các paper về robot như ABot-N1, ABot-AgentOS cho thấy cộng đồng đang rời xa benchmark ngắn, tiến tới những hệ thống có memory, planning, và khả năng hành động liên tục.
3. Đánh giá mô hình đang được xem xét lại từ gốc
Video-Oasis và RCORE nhấn mạnh một thông điệp rất quan trọng: nhiều benchmark hiện nay vẫn chứa shortcut. Nếu không sửa cách đo, chúng ta dễ ngộ nhận về tiến bộ thực sự.
4. Generative models đang trở thành mô hình nhận thức
Từ sinh video thời gian thực đến học representation cho vision, ranh giới giữa generator và understanding model đang mờ dần. Điều này có thể định hình thế hệ foundation model tiếp theo.
Nếu phải chọn 3 paper đáng chú ý nhất hôm nay theo tác động tiềm năng rộng, mình sẽ chọn:
Vidu S1 — vì mở ra khả năng video tương tác thời gian thực trên phần cứng phổ thông
Video-Oasis — vì đặt lại câu hỏi “ta có đang đánh giá đúng không?”
Weak-to-Strong Generalization via Direct On-Policy Distillation — vì giải bài toán chi phí RL rất thực tế
Nếu bạn muốn, ở bước tiếp theo mình có thể viết tiếp một bản “deep dive” 2000-3000 từ cho 3 paper nổi bật nhất, hoặc chuyển bài này thành format newsletter / LinkedIn post / script YouTube.
SOCIAL SHARE CARD GENERATOR