10 paper AI nổi bật nhất trên Hugging Face hôm nay: xu hướng mới từ agent, RL đến diffusion và world model
Hôm nay, top paper được cộng đồng Hugging Face upvote nhiều nhất cho thấy một bức tranh khá rõ về hướng đi hiện tại của AI: agent dài hạn, reinforcement learning cho LLM, tối ưu suy luận, benchmark hóa năng lực tác tử, và mô hình sinh có khả năng kiểm soát tốt hơn.
Trong bài viết này, mình sẽ đi qua 10 paper nổi bật, với mỗi paper gồm 4 ý chính:
- Bài toán
- Ý tưởng
- Điểm mới
- Ứng dụng thực tế
1) Program-as-Weights: A Programming Paradigm for Fuzzy Functions
Paper:2607.02512
GitHub:
Bài toán
Trong RL cho LLM, policy dùng khi huấn luyện và policy dùng khi suy luận thường không hoàn toàn giống nhau. Sự lệch giữa training và inference này khiến mô hình có thể tối ưu tốt trên giấy nhưng khi deploy lại không cải thiện tương ứng, thậm chí mất ổn định.
Ý tưởng
Paper cho rằng mục tiêu thật sự không nên chỉ là tối ưu training policy, mà phải đảm bảo inference policy cải thiện đơn điệu. Từ đó họ đề xuất một objective và framework mới để đồng bộ tốt hơn giữa huấn luyện và suy luận.
Điểm mới
Đây là một góc nhìn rất đáng chú ý: thay vì chăm chăm tối ưu reward trong quá trình train, paper nhấn mạnh rằng policy được sử dụng khi ra quyết định thực tế mới là thứ cần được tối ưu trực tiếp hoặc gián tiếp một cách đảm bảo.
Nói cách khác, paper chuyển trọng tâm từ “học tốt” sang “dùng tốt”.
Ứng dụng thực tế
Phù hợp với:
- LLM reasoning có sampling/phân nhánh,
- tác tử dùng reranking hoặc self-consistency khi inference,
- các pipeline RLHF/RLAIF cần ổn định hơn khi triển khai thật.
3) AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents
Paper:2607.02255
GitHub:
Bài toán
Transformer full-attention mạnh nhưng đắt đỏ ở ngữ cảnh dài. Linear attention rẻ hơn nhưng có thể giảm chất lượng. Bài toán là: làm sao chuyển một Transformer hiện có sang hybrid attention model mà vẫn giữ hiệu năng tốt?
Ý tưởng
Paper đề xuất FlashMorph, xem việc chọn layer nào giữ full-attention và layer nào đổi sang linear attention như một bài toán tối ưu có ràng buộc ngân sách.
Thay vì thay toàn cục một cách thủ công, họ dùng mô hình “morphable” với gate theo layer để tìm cấu hình lai tối ưu.
Điểm mới
Điểm mới là layer selection có nguyên tắc. Không phải mọi layer đều quan trọng như nhau cho long-context reasoning. Paper còn dùng:
- linearization regularization,
- distillation trên logits,
- finetuning cho long-context.
Ứng dụng thực tế
Rất thực dụng cho:
- LLM phục vụ tài liệu dài,
- code assistant với context lớn,
- hệ thống RAG cần cửa sổ ngữ cảnh dài nhưng chi phí hạn chế,
- chuyển đổi model hiện có sang bản suy luận rẻ hơn.
6) Multi-Resolution Flow Matching
Paper:2607.01642
GitHub:
Bài toán
Data agent đang được nói đến rất nhiều, nhưng benchmark hiện tại thường rời rạc, ít phản ánh đúng workflow data science ngoài đời, và thiếu cách đo bao phủ kỹ năng.
Ý tưởng
AgenticDataBench xây dựng benchmark toàn diện cho data agents, với task đa miền, annotation chi tiết và thước đo coverage dựa trên kỹ năng.
Điểm mới
Thay vì chỉ đo “đúng/sai”, benchmark cố gắng phản ánh:
- các mẫu vận hành dữ liệu thực tế,
- độ đa dạng domain,
- granularity mịn của task,
- bản đồ kỹ năng mà agent cần có.
Đây là hướng quan trọng vì data work không chỉ là viết code, mà còn gồm hiểu schema, kiểm tra dữ liệu, phân tích lỗi, trực quan hóa, và ra quyết định.
Ứng dụng thực tế
Hữu ích cho:
- đánh giá copilot dữ liệu,
- benchmark nội bộ cho AI analyst/data assistant,
- so sánh agent trên workflow BI, notebook, ETL và analytics.
8) WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory
Paper:2607.02517
Bài toán
Video generation hiện nay thường đẹp ở từng đoạn ngắn nhưng khó giữ tính nhất quán dài hạn: vật thể đổi hình, chuyển động thiếu logic, camera và thế giới không bền vững theo thời gian.
Ý tưởng
WorldDirector tách quá trình thành hai phần:
semantic motion planning ở mức cao,
visual rendering ở mức hình ảnh.
LLM được dùng để điều phối quỹ đạo 3D của vật thể và chuyển động camera, đồng thời duy trì persistent dynamic memory về thế giới.
Điểm mới
Điểm mới cốt lõi là đưa bộ nhớ động bền vững vào world simulator. Thay vì chỉ sinh khung hình kế tiếp từ ngữ cảnh gần, hệ thống duy trì trạng thái thế giới lâu hơn và dùng nó để kiểm soát motion lẫn viewpoint.
Ứng dụng thực tế
Rất tiềm năng cho:
- game content generation,
- mô phỏng ảo,
- phim hoạt hình AI,
- dữ liệu huấn luyện cho embodied agent hoặc robotics.
9) VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
Paper:2607.01804
GitHub:
Bài toán
Trong suy luận y khoa đa phương thức, chỉ cần sai ở một bước đầu là các bước sau có thể đổ vỡ theo dây chuyền. Nếu chỉ thưởng theo đáp án cuối, mô hình rất khó học được lỗi nằm ở đâu.
Ý tưởng
MRPO dùng step-wise process rewards để thưởng/phạt theo từng bước suy luận, thay vì chỉ nhìn kết quả cuối. Nhờ vậy, việc gán tín dụng trong RL tốt hơn và giảm hiện tượng failure cascade.
Điểm mới
Điểm mới nằm ở cách đưa nhận thức theo bước vào policy optimization cho bài toán medical multimodal reasoning. Đây là nơi tính đúng đắn quy trình đặc biệt quan trọng, không thể chỉ “đoán đúng kết quả”.
Ứng dụng thực tế
Ứng dụng rõ nhất là:
- hỗ trợ đọc ảnh y khoa,
- VQA lâm sàng,
- hệ thống AI cần giải thích từng bước cho bác sĩ,
- các domain rủi ro cao nơi quy trình suy luận quan trọng ngang kết luận.
Kết luận: 4 xu hướng lớn nổi bật
Nhìn tổng thể, 10 paper hôm nay hội tụ quanh 4 xu hướng rất đáng chú ý.
1. Agent không chỉ cần thông minh, mà cần có bộ nhớ và khả năng tự cải thiện
Điều này thể hiện rõ ở AgenticSTS, EvoPolicyGym và AgenticDataBench. Cộng đồng đang chuyển từ demo agent ngắn hạn sang đánh giá nghiêm túc các năng lực như memory, policy refinement và workflow thực tế.
2. RL cho LLM đang bước vào giai đoạn “thực dụng hơn”
Các paper như The Mirage of Optimizing Training Policies và MRPO nhấn mạnh rằng tối ưu reward thôi chưa đủ; phải xử lý đúng mismatch giữa train và inference, cũng như cải thiện credit assignment theo từng bước.
3. Hiệu quả suy luận là mặt trận cực nóng
FlashMorph, MrFlow và VLA-Corrector cùng nhắm vào việc giữ chất lượng nhưng giảm chi phí hoặc tăng độ phản ứng. Đây là tín hiệu rõ ràng rằng AI không chỉ chạy đua benchmark, mà còn chạy đua khả năng triển khai.
4. Mô hình sinh đang tiến tới thế giới có cấu trúc hơn
WorldDirector và Program-as-Weights tuy rất khác nhau, nhưng cùng chia sẻ một tinh thần: thay vì chỉ “phát sinh đầu ra”, hệ thống AI cần biểu diễn được cấu trúc, bộ nhớ, hoặc chương trình bên trong.
Lời cuối
Nếu phải chọn những paper đáng theo dõi nhất về tác động dài hạn, mình sẽ ưu tiên:
Program-as-Weights: vì nó gợi mở một paradigm lập trình AI rất khác,
The Mirage of Optimizing Training Policies: vì nó chạm đúng nút thắt của RL cho LLM,
AgenticSTS: vì memory là vấn đề trung tâm của agent dài hạn,
WorldDirector: vì controllable simulation có thể là nền tảng lớn cho embodied AI và video generation.
Nếu bạn muốn, mình có thể viết tiếp phần 2 theo một trong các hướng sau:
- Xếp hạng 10 paper theo mức độ tiềm năng ứng dụng
- Giải thích kỹ hơn từng paper theo kiểu dễ hiểu cho người không chuyên
- Tóm tắt 10 paper thành bảng so sánh 1 trang
- Phân tích paper nào đáng đọc full nhất đối với researcher/engineer/founder
SOCIAL SHARE CARD GENERATOR