Black Forest Labs ra mắt FLUX 3, mô hình video đa phương thức đầu tiên, đồng thời đã được Audi thử nghiệm để huấn luyện robot lắp ráp.
Black Forest Labs, phòng thí nghiệm AI của Đức nổi tiếng với dòng mô hình tạo ảnh FLUX, vừa phát hành FLUX 3 vào thứ Năm. Đây là lần đầu tiên mô hình chủ lực của công ty có khả năng tạo video thay vì chỉ tạo ảnh tĩnh như các phiên bản trước. Hệ thống mới được huấn luyện đồng thời trên dữ liệu hình ảnh, video và âm thanh trong một kiến trúc dùng chung, theo hướng tiếp cận đa phương thức, tức là một mô hình học đồng thời nhiều loại thông tin thay vì ghép nhiều công cụ riêng biệt lại với nhau.
Khả năng tạo video là điểm nhấn lớn nhất của FLUX 3. Mô hình có thể tạo các đoạn video dài tối đa 20 giây, trong đó âm thanh được tạo đồng thời với hình ảnh và đồng bộ với diễn biến trên màn hình, bao gồm lời thoại, hiệu ứng âm thanh và tiếng động môi trường. Trong các đánh giá ban đầu, người đánh giá ưu tiên đầu ra của FLUX 3 hơn Runway Gen-4.5 trong 77% số lượt so sánh trực tiếp và hơn Luma Ray 3.2 trong 93% số lượt so sánh, đồng thời nhỉnh hơn Gemini Omni và Seedance với tỷ lệ 52%.
Đây là phép thử về mức độ ưa thích dựa trên lựa chọn trực tiếp giữa hai đoạn video, không phải hệ thống chấm điểm theo tiêu chí cố định. Ngoài video, mô hình cũng thể hiện năng lực tạo ảnh tĩnh với tính linh hoạt cao, không giới hạn ở phong cách chân thực.
BFL định vị FLUX 3 không chỉ là công cụ tạo nội dung. Robin Rombach, đồng sáng lập kiêm Giám đốc điều hành công ty, cho rằng việc học cách dự đoán video đồng nghĩa với việc học các quy luật vật lý nền tảng như trọng lượng, sự tiếp xúc và thời điểm chuyển động, những yếu tố cần thiết để máy móc có thể di chuyển và hoạt động trong thế giới vật lý.
Ứng dụng FLUX-mimic được Audi thử nghiệm trong dây chuyền lắp ráp
Hướng tiếp cận này mang tên FLUX-mimic, được phát triển cùng mimic robotics, công ty robot có trụ sở tại Zurich. Hệ thống sử dụng bộ máy dự đoán video của FLUX 3, bổ sung một bộ giải mã gọn nhẹ để chuyển đổi khả năng nhận biết chuyển động vật thể thành chuyển động thực tế của robot. Audi đã thử nghiệm hệ thống trong các nhiệm vụ như lắp đặt gioăng cửa mềm, công việc mà các hệ thống tự động hóa truyền thống gặp nhiều khó khăn.
Christoph Schneider của Audi cho biết các robot hiện có thể xử lý những thao tác phức tạp với vật thể mềm mà máy móc thế hệ cũ không thực hiện được, trong khi BFL cho biết toàn bộ hệ thống có thời gian phản ứng khoảng 101 mili giây, gần tương đương phản xạ thị giác của con người.
FLUX 3 đánh dấu sự trở lại của BFL sau khi FLUX.2, phát hành tháng 11/2025, không đạt được mức độ phổ biến tương tự và để mất vị trí dẫn đầu mã nguồn mở vào tay Z-Image Turbo của Alibaba.
Tuy nhiên, mô hình mới hiện chưa được mở hoàn toàn: các phiên bản Video và Action mới cung cấp quyền truy cập sớm qua API cho một số đối tác như mimic robotics, tính năng tạo ảnh dự kiến ra mắt trong vài tuần tới, còn phiên bản Dev dùng trọng số mở để triển khai cục bộ phải đến cuối năm 2026 mới được phát hành.




































































