كشفت شركة جوجل (Google) النقاب عن نموذج جديد للذكاء الاصطناعي الصوتي يهدف إلى تقديم مستوى متطور وغير مسبوق في التعرف على الكلام وعمليات النسخ والتفريغ الصوتي.
يأتي النموذج الجديد تحت اسم Gemini 3.5 Transcribe، ويتميز بقدرات فائقة في تحويل الكلام إلى نصوص بدقة متناهية، مع قدرة تلقائية على التعرف على أكثر من 85 لغة.
والمميز حقاً في النموذج هو قدرته على أخذ الكلام البشري غير المترابط أو العشوائي (الثرثرة والتفكير بصوت مرتفع) وتحويله مباشرة إلى نصوص منسقة ومجدولة بوضوح، فضلاً عن إزالة كلمات الحشو (Filler words) تلقائياً واستخدام الأوامر الصوتية لإجراء التعديلات.
قدرات استثنائية في التعرف على المتحدثين والمفردات
وفقاً لتوضيح الشركة، يستطيع نموذج Gemini 3.5 Transcribe تعلّم المفردات المخصصة وأساليب التهجئة الفريدة، وهو بارع جداً في التقاط السلاسل الأبجدية الرقمية المعقدة مثل أرقام الطلبات والرموز البريدية.
كما يتمتع النموذج بقدرة فائقة على نسب الكلام إلى ما يصل إلى ثلاثة متحدثين مختلفين مع تحديد الطوابع الزمنية على مستوى الكلمة بناءً على الملفات الصوتية المسجلة مسبقاً، مما يجعله أداة مثالية لتفريغ المقابلات والبودكاست.
التكامل مع متصفح كروم وتطبيقات جوجل
لا يقتصر عمل النموذج على الاستخدامات المنفصلة؛ إذ يعد Gemini 3.5 Transcribe المحرك الأساسي لميزة Rambler على أجهزة أندرويد مثل هواتف Pixel 11، بالإضافة إلى تطبيق Gemini على نظام macOS (حيث يعمل جنباً إلى جنب مع نماذج جيميني الأخرى لتنفيذ المهام الذكية).
والأكثر إثارة للاهتمام هو إعلان جوجل أن المستخدمين سيتمكنون قريباً جداً من استخدام ميزة تحويل الكلام إلى نص (Speech-to-Text) في أي حقل إدخال نصوص على أي صفحة ويب في متصفح كروم.
على سبيل المثال، ستتمكن من إملاء الردود والمنشورات واستخدام صوتك لكتابة الأوامر مباشرة في المتصفح.
كما يتوفر النموذج الجديد في منصة التطوير التابعة للشركة Google Antigravity، وقريباً في خدمات Search Live وGemini Live وDocs وKeep وGmail، إلى جانب توفيره للمطورين عبر واجهات البرمجة (APIs).
