عندما أطلقت جوجل برنامج Gemini قبل ثلاث سنوات، كان الهدف هو بناء نموذج لغة كبير متعدد الوسائط – شبكة عصبية واحدة تم تدريبها على النصوص والصور والصوت والفيديو ويمكنها إنشاء محتوى بأي من هذه التنسيقات.
واليوم، في مؤتمر مطوري Google I/O، اتخذت الشركة خطوة ملموسة نحو هذا الهدف مع Gemini Omni، وهي عائلة جديدة من النماذج متعددة الوسائط التي يقول الرئيس التنفيذي لشركة Google، ساندر بيتشاي، إنها ستكون قادرة على “إنشاء أي شيء من أي مدخلات”.
سيبدأ Omni بالفيديو. يمكن للمستخدمين الآن دمج الصور والصوت والفيديو والنص، وبدلاً من مجرد تجميع هذه المدخلات معًا، يقوم Omni بالتفكير في كل منهم لإنتاج مخرجات متسقة. والنتيجة هي مقاطع فيديو عالية الجودة تعكس فهمًا للفيزياء والثقافة والتاريخ والعلوم.
يتيح Omni أيضًا للمستخدمين تحرير الصور باستخدام أوامر نصية عادية بدلاً من برامج التحرير المعقدة، على غرار برنامج Nano Banana من Google.
لدى Google بالفعل نموذج فيديو مخصص، Veo، يتيح للمستخدمين تحويل النصوص والصور إلى مقاطع فيديو، وحتى توجيه الصور الرمزية وتخصيصها. لكن نيكول بريشتوفا، مديرة إدارة المنتجات في Google DeepMind، تقول إن إصدار اليوم هو أكثر من مجرد تحديث لـ Veo: “إنها الخطوة التالية نحو التقدم في الجمع بين ذكاء Gemini وإمكانيات العرض لنماذج الوسائط لدينا”.
أحد الأمثلة التي قدمها كوراي كافوكوغلو، كبير تقنيي DeepMind، للصحفيين خلال مؤتمر صحفي يوم الاثنين: عندما تم إعطاء Omni مطالبة بسيطة مثل “شرح طي البروتين بالطين”، سرعان ما عرض مقطع فيديو لشرح إيقاف الحركة مع تعليق صوتي يقول: “تبدأ البروتينات كسلاسل من الأحماض الأمينية. وهي تطوى إلى أنماط مثل حلزون ألفا وأجزاء مسطحة تسمى صفائح بيتا، لتشكل شكلًا مثاليًا ثلاثي الأبعاد”.
إن الرؤية طويلة المدى لشركة Omni أوسع نطاقًا، حيث تتضمن النموذج المستخدم للقيام بأشياء مثل إنشاء صور من الصوت، أو الصوت من الفيديو.
وقال بيتشاي خلال المؤتمر الصحفي: “عندما أعلنا عن جيميني لأول مرة، كان أول نموذج للذكاء الاصطناعي لدينا متعدد الوسائط في الأصل”. “كنا نعلم أن تدريبه على مزيج من النصوص والأكواد والصوت والصور والفيديو من شأنه أن يمنحه فهمًا أعمق للعالم. ومع النماذج العالمية، ينتقل الذكاء الاصطناعي من التنبؤ بالنص إلى محاكاة الواقع. جيميني أومني هي الخطوة التالية في هذا الاتجاه.”
وكجزء من الإصدار، سيتمكن المستخدمون أيضًا من إنشاء مقاطع فيديو باستخدام الصور الرمزية الرقمية الخاصة بهم – وهو أمر شاعه OpenAI في تطبيق Sora الذي لم يعد موجودًا الآن مع Cameos. ولمنع التزييف العميق، سيتعين على المستخدمين المرور عبر منتج مخصص، والذي يتضمن تسجيل أنفسهم والتحدث علنًا بسلسلة من الأرقام، وفقًا لبريشتوفا. ثم يتم تخزين الصورة الرمزية لاستخدامها في المستقبل.
بالإضافة إلى ذلك، ستتضمن جميع مقاطع الفيديو التي تم إنشاؤها باستخدام Omni العلامة المائية الرقمية SynthID من Google، والتي تتيح للمستخدمين التحقق مما إذا تم إنشاء مقاطع الفيديو عبر منتجات Gemini.
النموذج الأول في العائلة هو Gemini Omni Flash، والذي سيتم طرحه اليوم على تطبيق Gemini وYouTube Shorts واستوديو AI Creative Studio Flow. سيكون Flash قادرًا على عرض 10 ثوانٍ من الفيديو، وهو ما تقول بريشتوفا إنه ليس قيودًا على النموذج، بل هو قرار يعتمد على الرغبة في إيصاله إلى المزيد من الأيدي وتوقع أن معظم المستخدمين لن يرغبوا في إنشاء مقاطع فيديو أطول بكثير بعد. ومع ذلك، هناك فترات فيديو أطول قيد الإعداد في المستقبل القريب.
يبدو أن Google تعمل على الترويج لـ Omni Flash كأداة استهلاكية أكثر. كانت الأمثلة التي قدمتها بريشتوفا وجابي بارث مارون، مهندس الأبحاث في DeepMind، في مكالمة مع TechCrunch حول استخدامات الصور الرمزية الرقمية، كلها شخصية: إنشاء مقطع فيديو لنفسك وأنت تفوز بجائزة أو تذهب إلى القمر، أو إزالة أحد المارة من خلفية مقطع فيديو قمت بالتقاطه أثناء إجازتك.
وقد عبر بارث مارون عن الأمر بشكل أكثر بساطة: “إنها مثل الميمات الشخصية”.
وقالت بريشتوفا: “لقد ركزنا بالتأكيد على جعل هذا سهل الاستخدام للمستهلكين”. “لم تتمكن العديد من عارضات الفيديو من اختراق هذه الهوة مع المستهلكين، لذا فهذه هي لعبتنا للقيام بذلك.”
تأتي سهولة الاستخدام مع تحذير: أشار بريشتوفا وبارث مارون إلى أن مطالبات التحرير يجب أن تكون محددة للغاية، وإلا فإن Omni يخاطر بالإفراط في التحرير أو تغيير العناصر التي يريد المستخدم الاحتفاظ بها عن غير قصد – وهي مشكلة قد يواجهها مستخدمو Nano Banana.
على الرغم من التركيز على المستهلك على المدى القريب، فإن آثار Omni المؤسسية والإبداعية واضحة، وستقوم Google بإتاحة Omni عبر واجهة برمجة التطبيقات (API) في الأسابيع المقبلة. إن أداة إنشاء الصور الرمزية – وهي إمكانية متاحة اليوم في Shorts – هي شيء تتوقع Google أن يلتقطه منشئو المحتوى. ولكن على نطاق أوسع، يمكن لسير العمل متعدد الوسائط من البداية إلى النهاية أن يحدث تحولًا بالنسبة للمعلنين وصانعي الأفلام.
تقوم شركة Startup Luma AI ببناء شيء مشابه، وهي أداة وكيلة يمكنها إنشاء حملة إعلانية كاملة بناءً على ملخص قصير وصورة المنتج، مدعومة بنموذجها “الموحد”.
وقالت بريشتوفا: “نحن في الواقع فخورون جدًا بقدرات عرض النص التي يتمتع بها النموذج، وهو أمر مفيد حقًا لأشياء مثل الإعلانات”. “إذا كنت تريد منتجًا في مكان ما، أو حتى مجرد شعار، فيجب أن يكون دقيقًا… نتوقع بالتأكيد أن يستخدم صانعو الأفلام وغيرهم من المبدعين هذا النموذج أيضًا.”
قد يتم تقديم حالات الاستخدام الأكثر احترافًا بشكل أفضل من خلال نموذج Omni Pro، والذي يجب أن يؤدي أداءً أفضل عبر جميع مهام Omni. لم تذكر Google متى ستطلق Pro حتى الآن، لكن Brichtova قالت إن ذلك سيحدث عندما “نشعر وكأننا في مرحلة حيث لدينا خطوة تغيير فوق Flash”.
تابع بقية الأخبار المهمة لـ Google IO 2026
لقد انتهى بحث Google كما تعلم
تقوم Google بتحديث تطبيق Gemini لمواجهة ChatGPT وClaude
تقدم Google برنامج Gemini Spark، وهو مساعد وكيل يعمل على مدار الساعة طوال أيام الأسبوع مع تكامل Gmail
كيفية استخدام وكلاء المعلومات الجديد من جوجل
عندما تقوم بالشراء من خلال الروابط الموجودة في مقالاتنا، قد نكسب عمولة صغيرة. هذا لا يؤثر على استقلالنا التحريري.

