BEIJING, TIONGKOK - Media OutReach Newswire - 24 Agustus 2026 - HiDream.ai hari ini meluncurkan HiDream-O1-World, sebuah model dunia interaktif omni-modal native yang memungkinkan pengguna menghasilkan dunia 3D yang lengkap dan dapat dijelajahi hanya dari satu perintah teks, gambar, atau kontrol interaktif.
Model ini menggabungkan tiga kemampuan inti - penjelajahan (roaming), penyuntingan (editing), dan interaksi - dan dibangun di atas arsitektur UiT (Unified Transformer) yang dikembangkan sendiri oleh HiDream.ai. UiT yang ditingkatkan ini memberikan terobosan penting pada dua tantangan persisten di bidang ini: konsistensi spasial-temporal dan konsistensi fisik. Saat kamera melakukan pan, zoom, atau pelacakan, geometri adegan tetap stabil - objek tidak menghilang atau berubah bentuk, serta tabrakan, okulasi, dan respons gravitasi mengikuti logika sebab-akibat dunia nyata, bukan tampak sebagai bingkai yang disambung secara acak.
"Nilai dari model dunia interaktif bukanlah menghasilkan adegan 3D yang fotorealistis - melainkan AI mulai benar-benar memahami kedalaman ruang, tekstur objek, inersia gerakan, dan logika cahaya serta bayangan," kata Yao Ting, CTO HiDream.ai. "Ini adalah rekonstruksi sistematis tentang cara kerja dunia fisik. HiDream-O1-World adalah jembatan pertama dalam rekonstruksi itu - setiap interaksi mengarah ke dunia yang belum pernah dijelajahi sebelumnya."
Langsung Memuncaki Papan Peringkat pada Debutnya
Hasil tolok ukur pihak ketiga pertama HiDream-O1-World berasal dari WBench, sebuah tolok ukur evaluasi model dunia interaktif yang dikembangkan bersama oleh tim LongCat Meituan dan Universitas Fudan. Model ini memuncaki papan peringkat utama Navi dengan skor rata-rata 80,9, menempati peringkat pertama dalam dimensi Fisik dengan 73,3, dan meraih skor 88,0 pada Konsistensi - kinerja keseluruhan terbaik di papan tersebut.
WBench mencakup 289 kasus interaksi multi-putaran dan 1.058 putaran interaksi di seluruh lima dimensi dan 22 metrik. Papan Navi-nya, yang berfokus pada navigasi spasial dan kontrol sudut pandang, secara luas dianggap sebagai ukuran inti pemahaman spasial model dunia. Dengan langsung memuncaki Navi pada entri pertamanya, HiDream-O1-World menetapkan batas kinerja baru untuk model dunia interaktif - mengungguli pemain mapan termasuk Tencent Hunyuan 1.5.
Pembuatan Dunia Sekali Klik untuk Interaksi Imersif
Model ini memungkinkan pengguna menghasilkan dunia interaktif yang lengkap secara struktural dan beragam secara gaya dari deskripsi singkat, satu gambar, atau kontrol sederhana. Unggah, misalnya, foto sebuah ruangan, dan model dengan cepat membangun kembaran digital berpresisi tinggi, melengkapi seluruh panorama dengan proporsi akurat dan detail halus.
Pengguna dapat menjelajahi dunia dalam mode orang pertama atau orang ketiga, dengan bebas mengendalikan karakter dan menyesuaikan sudut pandang. Dalam adegan menyelam, pola cahaya di permukaan air dan kilauan bias di dasar laut bergeser seirama dengan pergerakan kamera; tekstur karang tetap tajam dan tanpa perubahan selama penjelajahan.
Selain penjelajahan, HiDream-O1-World memungkinkan penyuntingan waktu-nyata - mengarahkan karakter untuk meraih, berlari, berjongkok, atau melompat, atau memicu peristiwa lingkungan seperti hujan. Perubahan tetap mempertahankan koherensi yang terpadu secara global di seluruh geometri, pencahayaan, material, dan logika fisik, memastikan setiap interaksi tetap konsisten dengan dirinya sendiri.
Model ini menggeneralisasi lintas manusia, hewan, dan karakter fiksi, beradaptasi dengan bentuk dan gerakan masing-masing. Dalam adegan pendakian salju, jejak kaki meninggalkan lekukan realistis di salju, kepingan salju melayang dengan kecepatan berbeda, dan garis punggung bukit yang jauh menyatu secara alami dengan tekstur batuan saat sudut pandang bergeser. Model ini mendukung beragam adegan dan gaya - mulai dari jalanan kota nyata dan medan alami hingga kartun bergaya anime dan rendering setara gim AAA.
Dua Terobosan Inti: Konsistensi Spasial-Temporal dan Fisik
Model dunia interaktif telah lama dibatasi oleh tiga masalah: ruang, fisika, dan memori. Perpindahan kamera menyebabkan kekaburan dan pergeseran adegan; pelanggaran fisika merusak kredibilitas; dan tanpa memori jangka panjang, objek menghilang saat pandangan berbalik. HiDream-O1-World mengatasi ini melalui dua kemampuan yang terkoordinasi:
Konsistensi spasial-temporal cakrawala panjang. Model ini memasangkan prior 3D yang disuntikkan ke dalam konteks Memori dengan pemeliharaan daring Test-Time Training (TTT). Mekanisme Memori mengkodekan geometri adegan dan hubungan antar objek sebagai prior 3D, memungkinkan model "mengingat" struktur yang telah dijelajahi di seluruh perpindahan sudut pandang - secara fundamental menghilangkan pergeseran dan pengaturan ulang adegan. TTT melakukan adaptasi daring ringan selama inferensi, secara dinamis mengoptimalkan adaptor sehingga representasi internal tetap selaras dengan kendala 3D adegan. Di mana model konvensional bertindak seperti pelukis yang menggambar ulang setiap bingkai - dengan kesalahan yang menumpuk menjadi pergeseran dan objek yang menghilang - HiDream-O1-World bertindak seperti sutradara dengan memori spasial: ia merekam struktur adegan daripada menebak-nebak ulang lingkungan di setiap langkah, mengingat tampilan yang sesuai saat kamera bergerak.
Konsistensi fisik yang stabil secara global. Di sisi pelatihan, simulator dunia generatif menghasilkan data sintetis yang mencakup tabrakan benda padat, gerakan fluida, deformasi benda lunak, dan proyektil berbasis gravitasi - secara sistematis memperkuat bias induktif model melalui data simulasi fisika. Di sisi inferensi, mekanisme TTT yang sama meningkatkan konsistensi fisik secara daring, menyesuaikan representasi saat jenis objek atau material baru muncul sehingga bingkai berikutnya lebih mengikuti fisika adegan tersebut. Desain mesin ganda ini menghasilkan peningkatan 13,6% di atas rata-rata industri pada evaluasi kewajaran visual dan 12,7% pada evaluasi kesetiaan kausal di seluruh dimensi fluida, tabrakan, dan deformasi.
Penelitian ini telah diterima di ECCV 2026 (European Conference on Computer Vision), salah satu dari tiga konferensi akademis terkemuka di bidang visi komputer dan AI.
Makalah: DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling
Halaman proyek: https://yanghb22-fdu.github.io/DreamWorld
Tiga Batas Industri Baru
Di luar terobosan teknis, HiDream-O1-World membuka kemungkinan baru bagi transformasi industri:
Film dan gim interaktif berbasis AI. Pengguna tidak lagi mengikuti alur cerita linear secara pasif, tetapi menjadi partisipan aktif, dengan dunia yang berkembang di sepanjang alur cerita bercabang - menghadirkan kualitas visual sinematik, imersi yang belum pernah ada sebelumnya, dan kenikmatan dari banyak akhir cerita.
Simulasi AI yang Terwujud (Embodied-AI). Model ini membangun ruang simulasi berpresisi tinggi yang berlandaskan fisika - kota, pabrik, interior - menyediakan tempat uji virtual untuk pelatihan robotika, mengemudi otonom, dan manufaktur cerdas, menggantikan pengujian dunia nyata yang berbiaya tinggi dan berisiko tinggi.
Produksi adegan 3D. Kreator dapat menghasilkan patung 3D, adegan rumah, dan ruang seni dengan struktur lengkap dan detail kaya, mendukung penyesuaian halus struktural dan peralihan gaya instan. Ini bahkan meluas ke dunia mikroskopis - mensimulasikan perilaku seluler dan interaksi protein untuk penemuan obat dan penelitian mekanisme penyakit.
Ketika dunia fisik dapat dihasilkan dengan satu klik dan dijelajahi dengan bebas, banyak industri layak untuk dibayangkan ulang. Bidang-bidang ini hanyalah puncak gunung es - saat semakin banyak pengembang dan kreator bergabung, batas aplikasi model dunia interaktif akan meluas jauh melampaui apa yang dapat dijelaskan saat ini.
Jangkau pembaca luas & terindeks Google News. Pilih paket rilis pers, advertorial, atau kemitraan media.