📰 Laman Utama 🔒 Log Masuk Admin
Jul 25, 2026 ⏰ 6 min read

FLUX 3 Ada Di Sini: AI Yang Mencipta Video Dengan Bunyi Daripada Teks Sahaja

Ingat apabila penjana imej AI hanya boleh menghasilkan gambar statik? Kemudian mereka belajar membuat video pendek — video senyap, seperti filem lama. Nah, era itu baru sahaja berakhir. Pada 23 Julai 2026, Black Forest Labs — pasukan Jerman di belakang model imej FLUX yang sangat popular — menggugurkan FLUX 3, dan jenis lompatan yang membuatkan anda berhenti dan berkata "Tunggu, ia boleh buat APA?"

Berikut ialah tajuk utama: FLUX 3 ialah model AI tunggal yang boleh menjana imej, klip video 20 saat DENGAN audio yang disegerakkan dan juga meramalkan tindakan fizikal untuk robotik — semuanya daripada satu gesaan teks. Tiada mencantumkan imej, video dan model audio yang berasingan. Satu model. Satu gesaan. Hasil yang termasuk bunyi.

Mari kita pecahkan maksud sebenarnya ini, mengapa ia penting, dan sama ada anda perlu mengambil berat tentangnya pada hujung minggu ini.

Apa yang Membuatkan FLUX 3 Berbeza?

Inovasi utama di sini ialah sesuatu yang dipanggil oleh pasukan multimodaliti yang dilatih bersama. Kebanyakan penjana media AI berfungsi dengan merantai model berasingan bersama-sama — anda menjana video dengan satu model, kemudian menyerahkannya kepada model lain untuk menambah audio dan berharap ia disegerakkan. FLUX 3 melakukan segala-galanya dalam satu pukulan.

Fikirkan dengan cara ini: model AI sebelumnya seperti mempunyai pengarah (prompt), kru kamera (model video) dan jurutera bunyi (model audio) yang bekerja di bilik berasingan dan berharap outputnya sepadan. FLUX 3 ialah seorang di belakang satu konsol yang mengendalikan segala-galanya secara serentak.

Hasilnya bercakap untuk diri mereka sendiri. Video sepintas lalu Black Forest Labs yang dikeluarkan menunjukkan:

  • Sebuah kereta memandu melalui bandar futuristik — deruan enjin disegerakkan dengan sempurna dengan visual
  • Ombak laut menghempas pantai — bunyi air, angin dan burung camar yang jauh semuanya sepadan dengan pemandangan
  • Demo memasak dengan bunyi mendesis sejajar dengan makanan yang terkena kuali
  • Seorang pemuzik memainkan alat dengan audio padanan kedudukan jari pada tali

Ini bukan pendekatan "video ditambah muzik latar belakang generik" yang pernah kami lihat sebelum ini. Model ini menjana audio asli yang sepadan dengan kandungan adegan — bunyi enjin untuk kereta, angin untuk pemandangan luar, tapak kaki untuk watak berjalan.

Betapa Kebaikannya, Betulkah?

Black Forest Labs menerbitkan hasil penanda aras secara bersemuka, dan jumlahnya mengagumkan. Dalam ujian keutamaan buta, pengguna memilih FLUX 3 berbanding:

  • Luma Ray 3.2 — 93% perbandingan menggemari FLUX 3
  • Landasan Gen-4.5 — 77% mengutamakan FLUX 3
  • Grok Imagine Video — 69% menggemari FLUX 3
  • Kling v3 Pro — 60% digemari FLUX 3

Keutamaan 93% berbanding Luma Ray 3.2 bukanlah kemenangan kecil — ia adalah satu kejayaan besar. Model ini menghasilkan video dalam empat varian produk:

VarianTujuanKetersediaan
Video FLUKS 3Penjanaan video + audioAkses Awal (mohon sekarang)
Imej FLUX 3Penjanaan imej statikDilancarkan dalam beberapa minggu
Tindakan FLUX 3Ramalan tindakan untuk robotikPratonton penyelidikan
FLUX 3 DevVersi berat terbukaLewat tahun ini

Varian "Tindakan" amat menarik — ia dilatih untuk meramalkan tindakan fizikal daripada input visual, pada asasnya memberi robot cara untuk "melihat" dan "bertindak" menggunakan kecerdasan asas yang sama. Itu perbualan yang berbeza, tetapi ia memberitahu anda ke mana arah tuju Black Forest Labs.

Maksud Ini untuk Pencipta

Jika anda mencipta kandungan — video YouTube, klip media sosial, pembentangan atau malah projek yang menyeronokkan — FLUX 3 mengubah permainan dalam beberapa cara penting:

Pengeluaran satu syot. Anda tidak perlu lagi menjana video, mengosongkannya ke dalam alat penyuntingan, menambah kesan bunyi daripada pustaka dan menyegerakkan semuanya secara manual. Satu gesaan boleh menghasilkan klip siap dengan visual DAN audio yang dimiliki bersama.

Bunyi yang masuk akal. Video yang dijana AI sentiasa berasa pelik senyap atau tidak sepadan dengan audionya. Penjanaan audio asli FLUX 3 bermakna bunyi hujan sebenarnya kedengaran seperti hujan, bukan gelung generik. Enjin kereta berputar pada padang yang betul. Langkah kaki hinggap di permukaan kanan.

20 saat ialah masa yang lama dalam video AI. Kebanyakan model video AI dihadkan pada 5-10 saat. Klip 20 saat FLUX 3 membenarkan adegan sebenar — urutan aksi pendek, tangkapan demo produk lengkap atau rentak naratif yang mempunyai ruang untuk bernafas.

Janji sumber terbuka. Black Forest Labs telah komited untuk mengeluarkan FLUX 3 Dev sebagai model open-weight pada akhir tahun ini. Jika rekod prestasi mereka dengan model FLUX terdahulu adalah sebarang petunjuk (dan ia sangat baik), komuniti sumber terbuka akan menjalankan ini pada GPU pengguna dalam masa beberapa minggu selepas dikeluarkan. Ini bermakna penjanaan video+audio yang dihoskan sendiri tanpa yuran setiap generasi.

Gambaran Lebih Besar: Model Bersatu Adalah Masa Depan

FLUX 3 ialah sebahagian daripada trend yang lebih besar yang semakin pantas sehingga 2026: peralihan daripada model AI khusus (satu untuk teks, satu untuk imej, satu untuk video, satu untuk audio) kepada model bersatu yang mengendalikan pelbagai modaliti secara semula jadi.

Fikirkanlah — manusia tidak memproses dunia melalui model yang berasingan. Apabila anda melihat kereta dipandu, anda melihatnya, mendengarnya dan memahaminya sebagai satu pengalaman. FLUX 3 mengambil pendekatan yang sama: daripada menjana video senyap dan menampal audio di atas, ia mencipta pengalaman audiovisual bersatu dari bawah.

Ini penting selain hanya membuat video yang menarik. Model audiovisual bersatu ialah:

  • Lebih cekap — satu larian latihan bukannya empat
  • Lebih konsisten — audio dan video secara semula jadi tergolong bersama kerana ia dilahirkan bersama
  • Lebih berskala — seni bina yang sama boleh diperluaskan kepada lebih banyak modaliti (sentuhan, gerakan, data spatial)

Patutkah Anda Mencubanya Hujung Minggu Ini?

Jika anda jenis orang yang gemar bermain dengan alatan AI baharu (dan jika anda membaca ini pada hari Sabtu, itu mungkin anda), FLUX 3 sememangnya berbaloi untuk mendaftar untuk Akses Awal. Proses permohonan adalah mudah — lawati tapak web Black Forest Labs, minta akses untuk Video FLUX 3 dan anda mungkin akan masuk dalam masa beberapa hari.

Bagi mereka yang benar-benar mencabar, mulakan gesaan sumbang saran yang menggabungkan adegan visual dengan audio tertentu. Model bersinar apabila anda menerangkan perkara yang anda lihat DAN perkara yang anda dengar dalam gesaan anda. Cuba sesuatu seperti:

> "Restoran berlampu neon vintaj pada tengah malam, hujan mencurah-curah di luar, dengan bunyi hon kereta api dari jauh dan burger mendesis di atas panggangan"

Gesaan adalah separuh daripada pertempuran dengan alat ini, dan FLUX 3 memberi ganjaran terperinci, perihalan kaya deria.

Intinya

FLUX 3 bukan sekadar satu lagi kemas kini tambahan dalam ruang video AI. Ia merupakan anjakan seni bina yang tulen — model sedia pengeluaran pertama yang menganggap visual dan audio sebagai satu masalah penciptaan bersatu dan bukannya dua tugas berasingan untuk disatukan. Keputusan penanda aras disokong oleh demo sebenar yang kelihatan dan kedengaran mengagumkan, dan janji keluaran berat terbuka pada akhir tahun ini bermakna keupayaan ini akan dapat diakses oleh semua orang tidak lama lagi, bukan hanya mereka yang mempunyai belanjawan perusahaan.

Untuk bacaan hari Sabtu, ini adalah jenis berita AI yang menarik dan praktikal — anda sebenarnya boleh mendaftar dan mencubanya. Dan dalam dunia di mana pengumuman AI kabur bersama-sama, itu menyegarkan.

Cubalah. Projek hujung minggu anda mungkin tidak akan sama.

Infografik: FLUX 3 — AI Yang Mencipta Video Dengan Bunyi

Infografik: FLUX 3 — AI Yang Mencipta Video Dengan Bunyi

← Back to Homepage

💬 0 Comments

☕ Support Eismar Tech Hub

🌎 International

Beli kopi

Credit Card / PayPal accepted

💳 Local (Malaysia)

Touch N Go QR

Touch 'n Go / DuitNow QR