Microsoft memperkenalkan Mage-VL, model multimodal 4B yang memproses video streaming seperti codec. Dengan mengurangi token visual hingga 75% dan inferensi 3.5x lebih cepat, Mage-VL membawa pemahaman video real-time ke skala yang efisien.
JoyAI-VL-Interaction adalah model vision-language interaction berskala 8B yang mampu melihat, berpikir, dan berinteraksi secara real-time tanpa menunggu perintah pengguna. Dikembangkan oleh JD.com dan dirilis sepenuhnya open-source.
Bayangkan Anda ingin membuat sebuah video pendek. Anda memerlukan aktor, kamera, lokasi, mikrofon, dan seorang sutradara untuk menyatukan semuanya. Proses ini rumit, mahal, dan memakan waktu. Kini, bayangkan jika Anda...
Light-A-Video adalah teknik terbaru yang memungkinkan mengubah pencahayaan dalam video tanpa memerlukan model khusus. Dikembangkan oleh tim peneliti dari Shanghai Jiao Tong University dan beberapa institusi lainnya. Tantangan utama dalam...
Deepfake: Teknik Manipulasi Video yang Mengerikan – Penggunaan machine learning dapat membantu manusia dalam menyelesaikan permasalahan dengan cepat dan akurat, dari mulai menganalisis data keuangan, membantu dalam mengambil keputusan, pendeteksian...
Pendeteksian Perkelahian dengan Machine Learning – Pernahkah anda menonton film yang berlatar waktu di masa depan dimana beberapa pekerjaan sudah digantikan oleh robot dengan kecerdasan buatan (artificial intelligence). Posisi yang...
