شركة Runway تكشف عن أحدث نموذج لإنشاء الفيديو من الأوامر النصية

أعلنت شركة الذكاء الاصطناعي Runway عن أحدث نماذجها لتوليد الفيديو من النصوص وهو الجيل 4.5 الذي يُنتج صورًا أكثر دقة من الجيل السابق.

وقالت الشركة إن نموذجها من الجيل 4.5 قادر على إنتاج “مخرجات سينمائية وواقعية للغاية”، مما قد يُصعّب التمييز بين الواقع والذكاء الاصطناعي.

وأفادت Runway في إعلانها: “يحقق الجيل 4.5 دقة فيزيائية وبصرية غير مسبوقة”. وأضافت أن نموذج الذكاء الاصطناعي الجديد أفضل في الاستجابة للطلبات، مما يسمح له بإنتاج مشاهد مفصلة دون المساس بجودة الفيديو.

وأكّدت الشركة أنّ الأجسام المُولّدة بالذكاء الاصطناعي “تتحرك بوزن وزخم وقوة واقعية”، بينما “تتدفق السوائل بديناميكيات مناسبة”.

سيتم طرح نموذج الجيل 4.5 لجميع المستخدمين تدريجيًا، وسيوفر نفس سرعة وكفاءة سابقه، وفقًا لـ Runway.

مع ذلك، لا تزال هناك بعض القيود، إذ قد يواجه النموذج مشاكل في ثبات الأشياء والاستدلال السببي، مما يعني أن التأثيرات قد تحدث قبل السبب، مثل فتح الباب قبل استخدام المقبض.

وقالت الشركة إن نموذجها الجديد أفضل في التعامل مع الأنماط المرئية المختلفة أيضًا، مما يسمح له بإنتاج صور أكثر اتساقًا وواقعية وأسلوبية وسينمائية.

تدعي الشركة الناشئة أن الصور المرئية الواقعية التي تم إنشاؤها باستخدام Gen-4.5 يمكن أن تكون “غير قابلة للتمييز عن لقطات العالم الحقيقي مع تفاصيل ودقة واقعية”.

مقالات قد تعجبك

روبوتات الدردشة ChatGPT و Copilot ستغادر واتساب قريباً
شركة بلاك شارك تكشف عن ساعة GS3 Ultra المتينة
الكشف عن تسريبات حول هاتف Xiaomi 17 Ultra
هواوي تطلق سلسلة هواتفها الجديدة Mate 80

جوجل تحدّث أداة Flow لإنشاء مقاطع فيديو بالذكاء الاصطناعي

تعمل شركة جوجل Google على جعل مقاطع الفيديو المُنشأة باستخدام أداة صناعة الأفلام بالذكاء الاصطناعي Flow أكثر واقعية، وأكثر صعوبة في التعرف عليها كمحتوى مُولّد بالذكاء الاصطناعي من النظرة الأولى.

وأعلنت الشركة يوم الأربعاء أن المستخدمين بات بإمكانهم إضافة وتعديل الظلال والإضاءة في مقاطع الفيديو الخاصة بهم.

ترتبط ميزات التحرير الموسعة في Flow بتحديث Veo 3.1، الذي أُعلن عنه أيضًا يوم الأربعاء، وتقول Google إنه يقدم أداءً أفضل في إنشاء الفيديو بناءً على الصور المُقدّمة كمحفّزات.

سيتمكن مستخدمو Flow أيضًا من إنشاء مقاطع فيديو مزود بصوت باستخدام عدة ميزات جديدة في الأداة، كما يستطيع المستخدمون إنشاء فيديو بصوت استنادًا إلى ثلاث صور مرجعية، تطلق عليها الشركة اسم “مكونات الفيديو” (Ingredients to Video).

كما تتضمن الأداة أيضاً ميزة أخرى تُدعى “Frames to Video” تقوم بإنشاء فيديو يربط بين صورة بداية وصورة نهاية، مع صوت مصاحب.

بالإضافة إلى ميزة “Scene Extension” التي تمكّن من أخذ الثانية الأخيرة من المقطع وإضافة فيديو مُولّد إضافي يصل إلى دقيقة واحدة، أيضًا مع صوت مُولّد

تبلغ تكلفة Veo 3.1 نفس تكلفة Veo 3، وهي متاحة كجزء من “معاينة مدفوعة” عبر Gemini API للمطورين، وتم تفعيلها في تطبيق Gemini.

وفقًا لشركة Google، سيتمكن مستخدمو Flow قريبًا من إزالة “أي شيء” من الفيديو، حيث ستقوم الأداة بإعادة هيكلة الخلفية والمشهد لجعل “الأمر يبدو وكأن العنصر لم يكن موجودًا من الأساس.”

مقالات قد تعجبك

سامسونج ستكشف عن أول نظارة رأس تعمل بنظام أندرويد XR الأسبوع القادم
تطبيق Copilot سيتمكن من إنشاء مستندات أوفيس والربط مع Gmail
فيس بوك تسهّل الحصول على عمل من خلال ميزة الوظائف
تطبيق Copilot سيتمكن من إنشاء مستندات أوفيس والربط مع Gmail

شركة OpenAI تطور نموذج ذكاء اصطناعي استدلالي يحمل الاسم o3

قامت شركة OpenAI بمعاينة مجموعة جديدة من نماذج الذكاء الاصطناعي الاستدلالية الجديدة التي أطلقت عليها اسم o3 و o3-mini.

وعلى الرغم من أن الشركة لم تطلق هذه النماذج رسمياً حيث أنها ما زالت في مرحلة التطوير، إلا أنها تقبل الطلبات المقدمة من مجتمع البحث لاختبار هذه الأنظمة قبل الإصدار العام (الذي لم تحدد موعدًا له بعد).

وكانت الشركة قد أطلقت نموذج o1 (الذي يحمل الاسم الرمزي Strawberry) في سبتمبر/أيلول الماضي، وهي تقفز مباشرة إلى o3، متخطية o2 لتجنب الخلط (أو تعارض العلامات التجارية) مع شركة الاتصالات البريطانية المسماة O2.

أصبح مصطلح الاستدلال كلمة طنانة شائعة في صناعة الذكاء الاصطناعي مؤخرًا، ولكنه يعني في الأساس أن الآلة تقوم بتقسيم التعليمات إلى مهام أصغر يمكن أن تؤدي إلى نتائج أقوى.

غالبًا ما توضح هذه النماذج كيفية وصول العمل إلى الإجابة، بدلاً من مجرد إعطاء إجابة نهائية دون تفسير.

ووفقا للشركة، فإن o3 يتجاوز سجلات الأداء السابقة في جميع المجالات، فهو يتفوق على سابقه في اختبارات البرمجة (التي تسمى SWE-Bench Verified) بنسبة 22.8 بالمائة ويتفوق على كبير علماء OpenAI في البرمجة التنافسية.

وكاد النموذج أن ينجح في واحدة من أصعب مسابقات الرياضيات (تسمى AIME 2024)، وفشل في الحصول على سؤال واحد، وحقق 87.7% في معيار المسائل العلمية على مستوى الخبراء (يُسمى GPQA Diamond).

ونجح o3 في حل 25.2 بالمائة من المشكلات (حيث لا يتجاوز أي نموذج آخر 2 بالمائة) في أصعب تحديات الرياضيات والاستدلال التي عادةً ما تعترض الذكاء الاصطناعي.

مقالات قد تعجبك

إنستغرام تخطط لإضافة ميزة لتحرير الفيديو بالاعتماد على الذكاء الاصطناعي
جوجل تختبر نموذج استدلالي جديد للذكاء الاصطناعي Gemini 2.0 Flash Thinking
الكشف عن المقطع الدعائي الأول للفيلم المنتظر Superman 2025
إنستغرام ستسمح لمستخدميها بتجميع لحظاتهم المفضلة في 2024
هل وسائل القفل الحيوية (البصمة والوجه) قوية؟

جوجل تختبر نموذج استدلالي جديد للذكاء الاصطناعي Gemini 2.0 Flash Thinking

طرحت شركة جوجل نموذجًا جديدًا للذكاء الاصطناعي وصفته الشركة بأنه “استدلالي” وقادر على الإجابة على الأسئلة المعقدة مع تقديم ملخص لأفكارها.

ويسمى هذا النموذج Gemini 2.0 Flash Thinking ويتم اختباره تجريبيًا الآن ومن المرجح أن يتنافس مع نموذج الاستدلال o1 الخاص بـ OpenAI.

وقال جيف دين كبير العلماء في DeepMind، إن النموذج “تم تدريبه على استخدام الأفكار لتقوية تفكيره”، ويستفيد أيضًا من السرعة التي تأتي مع نموذج Gemini Flash 2.0 الأسرع.

يوضح العرض التوضيحي الذي شاركه دين كيف يقوم برنامج Gemini 2.0 Flash Thinking بالإجابة على مشكلة فيزيائية من خلال “التفكير” من خلال سلسلة من الخطوات قبل تقديم الحل.

وهذا ليس بالضرورة “استدلالاً” في الطريقة التي يؤدي بها البشر ذلك، ولكنه يعني أن الآلة تقوم بتقسيم التعليمات إلى مهام أصغر يمكن أن تؤدي إلى نتائج أقوى.

مثال آخر، نشره لوغان كيلباتريك، رئيس منتج Google، يوضح النموذج وهو يفكر في طريقه لحل مشكلة تتضمن عناصر مرئية ونصية.

كان هناك عدد لا بأس به من التحديثات الملحوظة في مجال الذكاء الاصطناعي في الآونة الأخيرة، حيث كشفت جوجل عن نموذج Gemini 2.0 الذي تمت ترقيته في وقت سابق من هذا الشهر كجزء من دفع الشركة نحو الذكاء الاصطناعي “الوكيل”.

وفي الوقت نفسه، أتاحت OpenAI النسخة الكاملة من نموذج الاستدلال o1 الخاص بها لمشتركي ChatGPT.

مقالات قد تعجبك

بوكو تكشف عن هاتفين جديدين: Poco M7 Pro 5G و Poco C75 5G
آبل توقف تطوير خدمة اشتراك الأجهزة لهواتف آيفون
سوني تعزّز شراكتها مع AMD لدمج تقنيات الذكاء الاصطناعي في ألعاب بلاي ستيشن
إنستغرام ستسمح لمستخدميها بتجميع لحظاتهم المفضلة في 2024
هل وسائل القفل الحيوية (البصمة والوجه) قوية؟

جوجل تكشف عن نموذج Voe لإنشاء الفيديو بالاعتماد على الذكاء الاصطناعي

لقد مرت ثلاثة أشهر منذ أن قامت شركة OpenAI بالكشف عن نموذج الذكاء الاصطناعي الذي يُنشئ فيديو من المطالبات النصية والذي أسمته Sora.

والآن تحاول جوجل Google المنافسة من خلال إعلان نموذج جديد.

حيث كشفت الشركة في مؤتمر المطورين I/O يوم الثلاثاء عن نموذج Veo، وهو أحدث نموذج فيديو لها بتقنية الذكاء الاصطناعي.

ويستطيع هذا النموذج إنشاء مقاطع فيديو عالية الجودة بدقة 1080 بكسل مدتها دقيقة واحدة بمجموعة واسعة من الأنماط المرئية والسينمائية.

ويتمتع Veo بفهم متقدم للغة الطبيعية، وفقًا للبيان الصحفي الصادر عن Google، مما يمكّن النموذج من فهم المصطلحات السينمائية مثل الفاصل الزمني أو اللقطات الجوية للمناظر الطبيعية.

يمكن للمستخدمين أيضاً توجيه المخرجات المطلوبة باستخدام النصوص أو الصور أو المطالبات المستندة إلى الفيديو.

وتقول Google إن مقاطع الفيديو الناتجة ‘أكثر اتساقًا وتماسكًا’، وتصور حركة أكثر واقعية للأشخاص والحيوانات والأشياء خلال اللقطات.

كما هو الحال مع العديد من معاينات نماذج الذكاء الاصطناعي هذه، فمن المرجح أن يضطر معظم الأشخاص الذين يأملون في تجربة Veo بأنفسهم إلى الانتظار لبعض الوقت.

وقالت جوجل إنها دعت صانعي الأفلام والمبدعين المختارين لتجربة النموذج لتحديد من أجل إبداء الرأي، وليكون لهم دور في تطوير تقنيات الذكاء الاصطناعي من Google.

ويعتبر Veo أحد نماذج توليد الفيديو العديدة التي أنتجتها جوجل على مدار السنوات القليلة الماضية، بدءًا من Phenaki و Imagen Video، اللذين أنتجا مقاطع فيديو بدائية ومشوهة في كثير من الأحيان، إلى نموذج Lumiere الذي عرضته في يناير من هذا العام.

كان هذا الأخير واحدًا من أكثر النماذج إثارة للإعجاب التي رأيناها قبل الإعلان عن Sora في فبراير، حيث قالت Google إن Veo أكثر قدرة على فهم ما هو موجود في الفيديو، ومحاكاة فيزياء العالم الحقيقي، وتقديم مخرجات عالية الوضوح، والمزيد.

مقالات قد تعجبك

شركة OpenAI تفتح متجر GPT بشكل مجاني للجميع
متجر GPT من OpenAI أصبح متاحاً رسمياً
شركة OpenAI تكشف رسمياً عن نموذج GPT-4o مجاناً
كيفية حفظ كلمات المرور على جوجل كروم وحساب جوجل
كيفية إيقاف تشغيل اهتزاز وصوت لوحة المفاتيح على أندرويد