إتقان الأوامر متعددة الوسائط: دمج الصور مع النص

إتقان الأوامر متعددة الوسائط: دمج الصور مع النص

47 دقيقة
٣ سبتمبر ٢٠٢٦
المرحلة 1 من 7

ما هي النماذج متعددة الوسائط؟

لماذا يهمّك هذا الفصل؟ المشكلة الحقيقية التي يحلّها

لنفترض أنك تعمل على تقرير تسويقي، ولديك صورة لمنتج جديد، وتريد وصفًا دقيقًا وجاهزًا للنشر. الخيار التقليدي هو أن تكتب الوصف بنفسك، أو أن تفتح أداة ذكاء اصطناعي نصية وتكتب لها: "صف لي هذا المنتج". المشكلة أن الأداة النصية لا ترى الصورة. ستعطيك ردًا عامًا مبنيًا على تخمينات، أو ستطلب منك أن تصف الصورة لها أولًا — وهنا يضيع الهدف.

هذه هي المشكلة التي تحلّها النماذج متعددة الوسائط (Multimodal Models). هذه النماذج — مثل GPT-4o من OpenAI، وClaude 3.5 Sonnet من Anthropic، وGemini 1.5 Pro من Google — تستطيع معالجة نص وصورة معًا في نفس الوقت. أنت ترفع الصورة، وتكتب سؤالك أو طلبك، والنموذج يرى الصورة ويفهمها ويستجيب بناءً على ما رآه فعلًا، وليس على تخمين.

الفرق جوهري. عندما تطلب من نموذج نصي بحت أن يصف صورة، فأنت تطلب منه أن يتخيل. عندما تطلب من نموذج متعدد الوسائط، فأنت تطلب منه أن يلاحظ ثم يحلل ثم يكتب. النتيجة أدق، وأقل عمومية، وقابلة للاستخدام الفعلي في عمل حقيقي.

في هذا الدرس، سنتعلم ما هي النماذج متعددة الوسائط، وكيف نكتب أوامر (Prompts) تجمع بين الصورة والنص للحصول على نتائج دقيقة. سنمشي خطوة بخطوة مع مثال عملي كامل، ثم ننتقل إلى التطبيق.

ما هو النموذج متعدد الوسائط بالضبط؟

النموذج متعدد الوسائط هو نظام ذكاء اصطناعي مدرّب على فهم أكثر من نوع واحد من البيانات. في حالتنا هنا، النوعان هما: الصور والنصوص. النموذج يحوّل الصورة إلى تمثيل داخلي (تسلسل من الرموز أو المتجهات الرقمية) يفهم من خلالها محتوى الصورة: الأشياء، الألوان، الترتيب المكاني، النصوص الظاهرة داخل الصورة، وحتى المشاعر أو السياق العام إن كانت الصورة تعبيرية.

هذا يختلف جذريًا عن النماذج النصية البحتة التي تعالج النص فقط. عندما ترفع صورة إلى نموذج متعدد الوسائط، فأنت لا "تخبره" عن الصورة — بل هو "يراها". هذا يعني أنك تستطيع أن تطلب منه:

  • وصفًا دقيقًا لما في الصورة (لأغراض أرشفة أو إتاحة الوصول).
  • تحليلًا بصريًا (مثل: ما العناصر التي تلفت الانتباه أولًا؟).
  • توليد نص جديد بناءً على الصورة (مثل: منشور لوسائل التواصل الاجتماعي، أو نص بديل Alt Text).
  • استخراج معلومات من الصورة (مثل: قراءة نص من لقطة شاشة، أو جدول من صورة).
  • مقارنة بين صورتين (في إصدارات أحدث تدعم عدة صور).

المفتاح هنا أنك تكتب أمرًا (Prompt) يتضمن كلا النوعين: الصورة كسياق، والنص كتعليمة. جودة النتيجة تعتمد على جودة النص الذي تكتبه بنفس القدر الذي تعتمد عليه وضوح الصورة.

مثال عملي كامل: من صورة إلى منشور تسويقي

لنأخذ مثالًا واقعيًا. أنت تدير حسابًا لعلامة تجارية صغيرة تبيع قهوة مختصة. لديك صورة التُقطت بهاتفك لكيس قهوة جديد على طاولة خشبية، بجانبه كوب قهوة مُعدّ. تريد منشورًا لإنستغرام وفيسبوك.

الطريقة الخاطئة (مع نموذج نصي فقط): تكتب "اكتب منشورًا عن القهوة". النتيجة: منشور عام عن "متعة القهوة في الصباح" — لا يذكر شيئًا عن الكيس، ولا عن التصميم، ولا عن التفاصيل المرئية.

الطريقة الصحيحة (مع نموذج متعدد الوسائط): ترفع الصورة، وتكتب أمرًا محددًا. إليك الأمر الذي سنستخدمه في مثالنا:

أنت مدير تسويق لعلامة قهوة مختصة. انظر إلى الصورة المرفقة.
اكتب منشورًا لإنستغرام (بحد أقصى 150 كلمة) يتضمن:
1. وصفًا حسيًا لما يظهر في الصورة (الألوان، الإضاءة، العناصر).
2. فقرة قصيرة عن نكهة القهوة (تخيل أنها قهوة إثيوبية بنكهات الفواكه الحمراء).
3. دعوة لاتخاذ إجراء (زيارة الموقع أو المتجر).
4. 5 وسوم (هاشتاغ) مقترحة.
لا تذكر أنك ذكاء اصطناعي. اكتب بصوت علامة تجارية ودود ومحترف.

لاحظ أننا حددنا: الدور (مدير تسويق)، والمهمة (منشور إنستغرام)، والقيود (عدد الكلمات)، والمحتوى المطلوب (4 عناصر محددة)، والسياق (الصورة). هذا أمر احترافي لأن كل جزء فيه يوجّه النموذج نحو نتيجة قابلة للاستخدام.

النتيجة المتوقعة (مثال توضيحي)

عند تنفيذ هذا الأمر على GPT-4o أو Claude 3.5 Sonnet، ستحصل على شيء قريب من هذا (مع اختلافات طفيفة حسب النموذج):

☕ صباحكم معطر برائحة التوت البري!

في الصورة: كيس قهوتنا الجديد "مرتفعات يرجاتشيف" على طاولة خشبية دافئة، بجانب كوب مُعدّ بعناية. لاحظوا البنية الذهبية للكيس مع الخطوط الداكنة — صممناه ليعكس دفء المرتفعات الإثيوبية.

هذه الدفعة: إثيوبية يرجاتشيف، معالجة مغسولة. توقّعوا كوبًا ناعمًا بنكهات التوت الأحمر، والياسمين، ولمسة من الحمضيات. مثالية لصباح هادئ أو جلسة عمل مركزة.

متوفر الآن بكمية محدودة. جرّبوه اليوم، وأخبرونا برأيكم.

#قهوة_مختصة #إثيوبيا #يرجاتشيف #صباح_القهوة #متجرنا

لاحظ أن النموذج استخدم تفاصيل من الصورة (الطاولة الخشبية، الكوب، ألوان الكيس) ودمجها مع التعليمات النصية (النكهات، الدعوة لاتخاذ إجراء). هذا هو جوهر الأمر متعدد الوسائط.

التطبيق خطوة بخطوة (يمكنك تنفيذه الآن)

لتنفيذ هذا بنفسك، اتبع الخطوات التالية حرفيًا:

  1. اختر الأداة: افتح ChatGPT (بإصدار GPT-4o أو أحدث) أو Claude (بإصدار 3.5 Sonnet أو أحدث) أو Google Gemini (بإصدار Advanced). جميعها تدعم الصور.
  2. ارفع الصورة: في ChatGPT، انقر على أيقونة مشبك الورق (📎) بجانب حقل إدخال النص، واختر الصورة من جهازك. في Claude، انقر على أيقونة "+" ثم اختر الصورة. في Gemini، انقر على أيقونة الصورة.
  3. اكتب الأمر: انسخ الأمر أعلاه (في المثال العملي) والصقه في حقل النص. استبدل وصف النكهة بما يناسب منتجك إن كان مختلفًا.
  4. أرسل وراجع: اضغط Enter. بعد الرد، قيّم النتيجة: هل ذكرت تفاصيل مرئية صحيحة من صورتك؟ إذا كانت الإجابة لا، فالأمر يحتاج تحسينًا (راجع قسم الأخطاء الشائعة أدناه).
  5. كرر مع تعديل: إن كانت النتيجة عامة جدًا، أضف جملة للأمر: "ركز على العناصر المرئية التالية: [اذكر عنصرًا محددًا في صورتك]". هذا يوجّه النموذج لتفاصيل أنت تعرف أنها مهمة.

مثال إضافي: توليد نص بديل (Alt Text)

النص البديل ضروري لإتاحة الوصول (Accessibility) ولمحركات البحث. النموذج متعدد الوسائط ممتاز في هذه المهمة. الأمر:

الصورة المرفقة هي لقطة شاشة من موقعنا الإلكتروني.
اكتب نصًا بديلًا (Alt Text) لهذه الصورة بحيث:
- لا يتجاوز 120 حرفًا.
- يصف المحتوى الوظيفي (ماذا يفعل المستخدم في هذه الشاشة؟).
- يذكر النص الظاهر في الصورة حرفيًا إن وُجد.
- لا يبدأ بعبارة "صورة لـ".

هذا الأمر ينتج نصًا بديلًا دقيقًا يمكن لصقه مباشرة في كود HTML أو في نظام إدارة المحتوى (مثل WordPress).

الأخطاء الشائعة (وكيف تتجنبها)

أخطاء يقع فيها المبتدئون

  • الخطأ 1: أمر غامض. كتابة "صف هذه الصورة" فقط. النتيجة: وصف عام لا فائدة منه. الحل: حدد الغرض من الوصف (لأرشفة؟ لمنشور؟ لتقرير؟) والجمهور.
  • الخطأ 2: تجاهل الصورة في الأمر. بعض المستخدمين يرفعون الصورة ثم يكتبون أمرًا لا يشير إليها إطلاقًا، مثل "اكتب لي عن القهوة". النموذج سيرد بمعلومات عامة عن القهوة، ولن ينظر إلى الصورة لأنك لم تطلب منه ذلك. الحل: اذكر الصورة صراحةً في الأمر ("انظر إلى الصورة المرفقة").
  • الخطأ 3: طلب استحالة. مثلًا، طلب قراءة نص صغير جدًا أو مشوّه في صورة منخفضة الدقة. النموذج سيحاول وقد يخطئ. الحل: ارفع صورة بدقة أعلى، أو اذكر في الأمر أن النص قد يكون غير واضح واطلب منه أن يقول "غير واضح" بدل التخمين.
  • الخطأ 4: عدم تحديد القيود. إذا لم تحدد طول الرد أو النبرة أو البنية، فستحصل على رد عشوائي. الحل: حدد دائمًا: عدد الكلمات، النبرة (رسمية/ودودة)، والبنية المطلوبة (فقرة؟ قائمة؟).

نصيحة الخبراء

نصيحة الخبراء: لا تصف الصورة — اجعل النموذج يصفها، ثم صحّحه

أكبر خطأ يرتكبه المبتدئون هو أنهم يكتبون وصفًا للصورة في الأمر (مثل: "هذه صورة لكيس قهوة بني على طاولة...") ثم يطلبون من النموذج استخدام هذا الوصف. هذا يهدر قدرة النموذج البصرية ويجعل النتيجة محدودة بوصفك أنت — فإن أخطأت في وصف لون أو عنصر، فالنموذج سيتبع خطأك.

الطريقة الاحترافية: ارفع الصورة، واكتب أمرًا يطلب من النموذج أن يصف هو ما يراه أولًا، ثم يبني على هذا الوصف. مثال: "أولًا، اكتب 3 جمل تصف العناصر المرئية في الصورة بدقة. ثانيًا، بناءً على هذا الوصف، اكتب منشورًا تسويقيًا." هذا الأسلوب يجعلك ترى ما يراه النموذج، ويمكنك تصحيحه إن أخطأ في الفهم قبل أن يبني على الخطأ. إن لاحظت أن وصفه غير دقيق (مثلًا قال "كوب أزرق" وهو في الحقيقة أخضر)، فصحّحه مباشرة: "الكوب أخضر وليس أزرق. أعد كتابة المنشور مع هذا التصحيح." هذه حلقة تحكم (Feedback Loop) هي ما يفصل بين مستخدم عادي ومحترف.

مهمة تطبيقية (أقل من 15 دقيقة)

لنتأكد من أنك فهمت وتستطيع التنفيذ. أكمل المهمة التالية:

  1. اختر أي صورة من جهازك (صورة منتج، لقطة شاشة، صورة طعام — أي شيء).
  2. افتح نموذجًا متعدد الوسائط (ChatGPT أو Claude أو Gemini).
  3. ارفع الصورة، واكتب الأمر التالي (عدّله ليناسب صورتك):
انظر إلى الصورة المرفقة. اكتب منشورًا لوسائل التواصل الاجتماعي (منصة: LinkedIn) بحيث:
- الفقرة الأولى: تصف ما تراه في الصورة بدقة (3 جمل على الأقل).
- الفقرة الثانية: تربط هذا المحتوى بنصيحة عملية أو درس مستفاد.
- النبرة: مهنية وواثقة.
- الطول: 100-120 كلمة.
- لا تستخدم وسوم (هاشتاغ).
  1. بعد حصولك على النتيجة، قيّمها بنفسك: هل الوصف في الفقرة الأولى مطابق للصورة فعلًا؟ هل النصيحة في الفقرة الثانية منطقية ومرتبطة بالصورة؟
  2. إن وجدت خطأ في الوصف، صحّحه في رسالة متابعة (مثل: "لاحظت أنك وصفت الخلفية بأنها بيضاء وهي في الحقيقة رمادية. أعد كتابة المنشور مع هذا التصحيح.") ولاحظ كيف يتغير الرد.

معيار النجاح: إذا كان بإمكان شخص آخر لم يرَ الصورة أن يقرأ منشورك ويتخيل الصورة بدقة 80% على الأقل، فقد نجحت في كتابة أمر متعدد الوسائط فعال. إذا لم يحدث ذلك، راجع قسم الأخطاء الشائعة وحاول مرة أخرى بتعديل أمرك.

جاري تحميل التقييمات...