
كشفت شركة قوقل خلال مؤتمر Google I/O 2025 عن الجيل الثالث من نموذجها المتقدم لتوليد الفيديوهات بالذكاء الاصطناعي Veo 3، والذي يتميّز بقدرته على إنتاج مشاهد مرئية عالية الجودة مدعومة بمؤثرات صوتية، أصوات خلفية، وحتى حوارات متزامنة مع الصور.
أبرز مميزات نموذج Veo 3
يُعد Veo 3 تطورًا كبيرًا مقارنة بالإصدار السابق Veo 2، إذ يمكنه الآن فهم محتوى الفيديو نفسه وتوليد صوت يتوافق بدقة مع الحركة والمشهد المعروض، وفقًا لما صرّح به “ديميس هسابيس”، الرئيس التنفيذي لـ Google DeepMind، خلال المؤتمر الصحفي قائلاً:
“للمرة الأولى، نخرج من عصر الصمت في إنشاء الفيديوهات بالذكاء الاصطناعي”.
النموذج الجديد متاح الآن عبر تطبيق Gemini للمشتركين في باقة AI Ultra من قوقل، والتي تبلغ كلفتها 249.99 دولارًا شهريًا، ويقبل Veo 3 التعليمات النصية أو الصور كنقطة انطلاق لإنشاء الفيديو.
وبحسب قوقل، تم تطوير النموذج استنادًا إلى جهود سابقة من DeepMind في مجال “تحويل الفيديو إلى صوت”، حيث درّبت الشركة النموذج على مزيج من المقاطع المرئية والنصوص الحوارية، دون تأكيد رسمي على ما إذا كان قد تم استخدام محتوى من يوتيوب لهذا الغرض، رغم أن المنصة مملوكة لشركة قوقل.
ولتقليل مخاطر التزييف العميق (Deepfake)، أوضحت الشركة أنها تعتمد تقنية SynthID لوضع علامات مائية غير مرئية داخل كل إطار يتم توليده بواسطة Veo 3.
كما أعلنت قوقل عن تحديثات جديدة لنموذج Veo 2، تشمل أدوات لتحسين الاتساق في الفيديوهات باستخدام صور شخصيات أو أنماط، إضافة لدعم حركات الكاميرا مثل الدوران والتكبير، وإمكانية تعديل محتوى المشاهد من خلال الحذف أو الإضافة، وتحويل الأبعاد من عمودية إلى أفقية.
ومن المقرر أن تتوفر هذه القدرات قريبًا على منصة Vertex AI API الخاصة بجوجل لدعم المطورين.








