Alibaba, Wan2.1-VACE adında, açık kaynaklı bir yapay zeka modeli tanıttı. Bu model, video oluşturma ve düzenleme yöntemlerini değiştirmeyi amaçlıyor.

VACE, Alibaba’nın Wan2.1 video yapay zeka modelleri ailesinin bir parçasıdır. Şirket, bu modeli için “birçok video üretim ve düzenleme görevine yönelik birleşik çözüm sunan ilk açık kaynaklı model” iddiasında bulunuyor.

Alibaba, kullanıcıları birçok ayrı aracı kullanmaktan alıkoyup tek bir merkezi araca yönlendirebilirse, gerçek bir devrim yaratabilir.

Peki, bu model ne yapabiliyor? Öncelikle, metin komutları, durak görüntüler ve diğer video kliplerin parçaları ile video oluşturabilir.

Ayrıca, sıfırdan video oluşturmakla sınırlı değil. Düzenleme aracı, tasarıdan resimlere veya belirli karelere atıfta bulunmayı destekleyerek, video “yeniden boyama” gibi gelişmiş özellikler sunuyor.

Alibaba, bu özelliklerin “çeşitli görevlerin esnek birleşimini artırarak yaratıcılığı geliştirdiğini” belirtiyor.

Illustration showing the Alibaba Wan2.1-VACE (Video All-in-one Creation and Editing) open-source AI model, a powerful tool.

Bir video oluşturmak için karakterlerin etkileşimde bulunduğunu hayal edin. VACE, bunun mümkün olduğunu iddia ediyor. Hareketsiz bir görüntünüze doğal hareket eklemek de mümkün.

Detaylı düzenleme sevenler için gelişmiş “video yeniden boyama” özellikleri mevcut. Bu, bir nesneden diğerine poz aktarımı, hareket kontrolü, derinlik algılaması ayarlama ve renk değiştirme gibi işlevleri içeriyor.

Gözümde çarpan bir özellik ise “seçilen belirli alanlarda ekleme, değiştirme veya silme yapabilme” yeteneği. Bu, detaylı düzenlemeler için büyük bir avantaj sağlıyor.

Bir düz fotoğrafı video haline getirip, nesnelere hareket çizme talimatı verebilirsiniz. Bir karakteri ya da nesneyi değiştirmek gerekirse, bunu da çok kolay yapabilirsiniz.

Alibaba, açık kaynaklı AI modelinin dik, ince bir görseli geniş ekran bir videoya dönüştürme yeteneğini örnek olarak veriyor. Diğer görüntüleri referans alarak yeni parçalar ekleyebiliyor.

VACE, karmaşık video düzenleme süreçlerini yönetmek için gelişmiş teknoloji kullanıyor. Temel bir parça, Alibaba’nın “Video Condition Unit” (VCU) dediği, “metin, görüntü, video ve maskeler gibi çok modlu girdilerin birleşik işlenmesini destekleyen” yapıdır.

Ayrıca, “Bağlam Adaptörü yapısı” da mevcut. Bu mühendislik harikası, “zaman ve mekanın biçimlendirilmiş temsili ile çeşitli görev kavramlarını ortaya koyuyor.” Yani, yapay zekanın video içindeki zaman ve mekânı iyi anladığını söyleyebiliriz.

Alibaba, VACE’nin sosyal medya klipleri, dikkat çekici reklamlar, ağır iş sonrası özel efektler ve eğitim videoları üretiminde hit olacağını öngörüyor.

Bu kadar güçlü AI modellerinin geliştirilmesi genellikle yüksek maliyetli ve büyük veri gücü gerektirir. Wan2.1-VACE’nin açık kaynak olması ise büyük bir olay.

Alibaba, “Açık erişim, daha fazla işletmenin AI’dan faydalanmasını sağlıyor. Bu da onları hızlı ve uygun maliyetle yüksek kaliteli görsel içerik üretmeye yönlendiriyor” şeklinde açıklamada bulundu.

Alibaba, daha fazla bireysel yaratıcının ve küçük işletmelerin elit bir AI modeline ulaşmasını sağlamayı hedefliyor. Bu güçlü araçların demokratikleşmesi her zaman memnuniyet verici.

Şirket yalnızca bir versiyon sunmuyor. Ciddi hesaplama gücü olanlar için 14 milyar parametreli bir model ve daha hafif sistemler için 1.3 milyar parametreli bir model mevcut. Bu modelere şu anda Hugging Face ve GitHub üzerinden ya da Alibaba Cloud’un açık kaynak topluluğundan erişim sağlayabilirsiniz.

(Görsel kaynağı: www.alibabagroup.com)

Ayrıca: ABD, AI Difüzyon Kuralı’nı durdurdu; çip ihracat kısıtlamalarını sertleştirdi

Haberin orijinalini okumak isterseniz tıklayın.