Microsoft memperkenalkan Mage-VL, model multimodal 4B yang memproses video streaming seperti codec. Dengan mengurangi token visual hingga 75% dan inferensi 3.5x lebih cepat, Mage-VL membawa pemahaman video real-time ke skala yang efisien.
Fish Audio S2 adalah sistem text-to-speech open-source terbaru yang mampu menghasilkan suara multi-speaker dan mengikuti instruksi bahasa alami secara presisi dengan arsitektur Dual-AR, pipeline data tiga tahap, dan RL post-training multi-reward.
JoyAI-VL-Interaction adalah model vision-language interaction berskala 8B yang mampu melihat, berpikir, dan berinteraksi secara real-time tanpa menunggu perintah pengguna. Dikembangkan oleh JD.com dan dirilis sepenuhnya open-source.
Pembelajaran Berbasis Memori AI – Agen Large Language Model (LLM) yang ada saat ini menghadapi dua batasan fundamental. Pertama adalah mengandalkan kerangka kerja khusus dengan alur kerja yang kaku dan...
Saat ini, kecerdasan buatan (AI) sudah bisa menjawab banyak pertanyaan. Namun, AI sering kesulitan jika diberi tugas riset yang rumit, jenis tugas yang mengharuskan kita membuka banyak situs, membandingkan data,...
Bayangkan Anda ingin membuat sebuah video pendek. Anda memerlukan aktor, kamera, lokasi, mikrofon, dan seorang sutradara untuk menyatukan semuanya. Proses ini rumit, mahal, dan memakan waktu. Kini, bayangkan jika Anda...
Light-A-Video adalah teknik terbaru yang memungkinkan mengubah pencahayaan dalam video tanpa memerlukan model khusus. Dikembangkan oleh tim peneliti dari Shanghai Jiao Tong University dan beberapa institusi lainnya. Tantangan utama dalam...
Hunyuan3D 2.0: Membuat Model 3D dengan Mudah – Perkembangan generative AI tidak hanya dapat membuat gambar dari perintah teks, kini dapat membuat aset 3D atau tiga dimensi dengan mudah, tanpa...
IMAGDressing-v1: Virtual Dressing Masa Depan – Perpindahan kebiasan belanja dari toko fisik seperti di pasar menjadi e-commerce online sudah terjadi beberapa dekade ini. Didorong oleh beberapa momentum dari mulai berkembang...
Whisper: AI yang Mampu Mengenali Suara Manusia – Apakah anda familiar dengan kalimat perkataan’hey siri’ atau ‘ok google’ ? kedua kalimat tersebut diucapkan untuk mengaktifkan asisten virtual Apple dan Google....
