ما مدى دقة التعرّف على الطعام بالذكاء الاصطناعي؟ وما الذي تتوقّعه
نُشر في أبريل 2026
تسجيل صور الوجبات بالذكاء الاصطناعي أسرع بكثير من البحث اليدوي في قاعدة بيانات الأطعمة. لكن سؤالاً شائعاً قبل التحول إليه هو: ما مدى دقته فعلياً؟ الإجابة الصادقة أن ذلك يعتمد على ما تأكله وكيفية تصويره. إليك ما تستطيع هذه التقنية فعله وما لا تستطيعه.
كيف يعمل التعرّف على الطعام بالذكاء الاصطناعي
عندما تلتقط صورة لوجبة، يقوم نموذج رؤية بالذكاء الاصطناعي بتحليل الصورة لتحديد الأطعمة الفردية. وهو ينظر إلى الأشكال والألوان والقوام والسياق لتحديد ما هو موجود في الطبق. بعد تحديد الأطعمة، يقدّر النظام أحجام الحصص بناءً على الإشارات البصرية، بما في ذلك الحجم الظاهري لكل عنصر مقارنة بالطبق أو أدوات المائدة أو نقاط مرجعية أخرى في الإطار.
من تلك التقديرات، يحسب السعرات والعناصر الغذائية الكبرى باستخدام القيم الغذائية للأطعمة المحددة. تستغرق العملية كلها بضع ثوانٍ عادة.
ما مدى دقته؟
بالنسبة للوجبات الشائعة الظاهرة بوضوح، التعرّف على الطعام بالذكاء الاصطناعي دقيق إلى حد معقول. طبق فيه صدر دجاج وأرز وخضار مطهوة بالبخار هو نوع الوجبات التي يؤدي فيها الذكاء الاصطناعي أداءً جيدًا. فالمكونات المنفردة مرئية، وأحجام الحصص قابلة للتقدير، والأطعمة مما رآه النموذج مرات كثيرة. في حالات كهذه، تكون تقديرات السعرات عادةً ضمن 10 إلى 20% من الرقم الفعلي.
تنخفض الدقة مع الأطباق المختلطة. يحتوي طبق يخنة أو كاسرول أو كاري على مكونات مخفية جزئياً أو كلياً. يستطيع الذكاء الاصطناعي التعرّف على نوع الطبق، لكنه لا يستطيع رؤية ما بداخله، لذا تعتمد التقديرات على الوصفات النمطية أكثر من اعتمادها على ما هو موجود فعلياً في قدرك. ويتسع نطاق الخطأ نتيجة لذلك.
الصلصات والزيوت والتتبيلات صعبة باستمرار. سلطة متبّلة بزيت الزيتون وسلطة متبّلة بصلصة خل خفيفة تبدوان متطابقتين تقريبًا في الصورة. والفرق في السعرات بينهما قد يكون كبيرًا. أما زيوت الطهي المضافة إلى المقلاة قبل القلي السريع فغير مرئية إطلاقًا في الصورة النهائية.
الأطعمة المعبّأة التي تحمل ملصقات غذائية يُفضّل التعامل معها بالإدخال اليدوي أو بمسح الباركود. حصة 200 غرام من نوع محدّد من الزبادي التجاري لها ملف غذائي معروف ودقيق. تحليل الذكاء الاصطناعي يضيف عدم يقين لا داعي له بينما الحقيقة مطبوعة على العبوة.
ما الذي يؤثر على الدقة
تؤثّر عدة عوامل عملية في مدى جودة أداء الذكاء الاصطناعي على أي صورة:
- الإضاءة. تمنح الصور جيدة الإضاءة النموذج معلومات بصرية أكثر للعمل عليها. الإضاءة الضعيفة تُسطّح القوام وتقلل من دقة الألوان، مما يجعل تحديد الطعام بشكل صحيح أصعب.
- الزاوية. الصور من أعلى (فوق الطبق مباشرة) تميل إلى إنتاج أفضل النتائج. أما الزوايا الجانبية فقد تحجب أصنافًا خلف أخرى وتجعل تقدير الحصة أقل موثوقية.
- ترتيب الطعام. الأطعمة الموزعة على الطبق في حصص منفصلة أسهل في التحليل من التقديم المكدّس أو المخلوط. إذا كنت تتناول أصنافًا متعددة، فتوزيعها قبل التصوير يساعد.
- أجسام مرجعية. يساعد تضمين حافة طبق، أو شوكة، أو جسم مألوف آخر داخل الإطار النموذج على معايرة حجم الحصة. تبدو قطعة الدجاج مختلفة جداً من حيث الحجم بجانب شوكة مقارنةً بجانب لا شيء.
الوجبات المختلطة أصعب من الأطعمة المفردة
صدر دجاج مشوي بجانب أرز وبروكلي هو ثلاثة أشكال منفصلة بحوافّ واضحة. أما الكاري أو اليخنة أو طبق الفرن أو السلطة المتبّلة فهو كتلة بصرية واحدة تتداخل فيها المكوّنات وتحجب بعضها بعضاً وتتفاوت في كثافتها. ويقدّر الذكاء الاصطناعي النوع الثاني بدقة أقل بكثير، وهذا أكبر عامل منفرد يتنبّأ بما إذا كان تقدير الصورة سيكون قريباً من الصواب.
المراجعة المنهجية لعام 2023 في Annals of Medicine، التي غطّت 52 دراسة نُشرت بين 2010 و2023، وجدت أن متوسط الأخطاء النسبية للسعرات يتراوح بين 0.10% و38.3%، وأفادت بأن الأخطاء "مالت إلى أن تكون أصغر في صور الطعام المفرد مقارنة بصور الأطعمة المتعددة". وهي تحدد الحالة الصعبة مباشرة: "الصور التي تضم أطباقًا مختلطة (مثل الكاري) أو أطباقًا فيها تشكيلة من الأطعمة المتداخلة بارتفاعات متفاوتة أو بحدود غير واضحة تمثل خطرًا أعلى لأخطاء التصنيف أو التقسيم". ومن بين أدنى 22 خطأ في تقدير الحجم عبر الدراسات المراجَعة، جاء 68% من صور طعام مفرد.
وضع تحليل من عام 2023 لأداء GPT-4V مقابل وجبات مرجعية موزونة أرقامًا على هذه الفجوة. تقدير صنف طعام واحد في المرة أنتج متوسط خطأ مطلق قدره 69.2 كيلوسعرة. أما تقدير وجبة الأكل كاملة فأنتج 151.2 كيلوسعرة، أي الضعف تقريبًا. السبب تراكمي: حجم الحصة هو المصدر الأكبر للخطأ، والطبق المختلط يتطلب حكمًا منفصلًا على الحصة لكل مكوّن، وكل حكم يحمل خطأه الخاص.
هذا الأمر ليس محسومًا تمامًا. دراسة عام 2025 في Nutrients حلّلت 195 طبقًا ووجدت ارتباطًا ضعيفًا فقط بين عدد المكونات ونسبة الخطأ (r لا يتجاوز 0.37)، وخلصت إلى أن عدد المكونات ليس عاملًا حاسمًا. الخلاصة الصادقة أن قابلية الفصل البصري تهم أكثر من عدد المكونات: طبق يحمل ستة أطعمة منفصلة بوضوح أسهل من وعاء يحمل ثلاثة أطعمة ممزوجة.
ما معنى ذلك عمليًا
- صوّري قبل الخلط. التقطي المكونات وهي ما تزال متمايزة، لا الوعاء بعد تقليبه.
- قسّم الوجبة المختلطة إلى صورتين حيثما أمكن ذلك بشكل معقول. تقديران مفردان أفضل من تقدير مركّب واحد.
- صحّح التقدير لكل ما هو مخلوط أو مغطّى بصلصة أو مرصوص بطبقات. الدهون هي العنصر الأكثر تقديرًا بأقل من قيمته في كل الدراسات، والزيت في الصلصة غير مرئي في الصورة.
- تعامل مع اليخنات والكاري المنزلي باعتبارها أسوأ حالة، وسجّلها من المكونات بدل الصورة حين تكون الوجبة مهمة.
بالمقارنة بماذا؟
المقارنة المفيدة ليست بين الذكاء الاصطناعي ورقم مثالي، بل بينه وبين الطريقة التي كنت ستسجّل بها الوجبة لولاه، وهي أيضاً غير دقيقة.
طلبت دراسة أُجريت عام 2018 ونُشرت في مجلة Nutrients من 38 أخصائي تغذية تقدير كمية الحصص من صور الطعام. لم تقترب سوى 23.7% من تقديراتهم للأطباق من الوزن الفعلي المقاس بنسبة 10%، بمتوسط نسبة خطأ مطلقة بلغ 47.6%. وفي دراسة Nutrition5k التي عُرضت في مؤتمر CVPR 2021، والتي وزنت كل مكوّن في نحو 5,000 طبق، بلغ متوسط نسبة الخطأ لدى أخصائيي التغذية المحترفين 41% مقابل 53% لغير المحترفين.
والتسجيل اليدوي في التطبيقات ليس أفضل حالًا. فتحليل بَعْدي عام 2022 في Advances in Nutrition جمع 11 دراسة لتطبيقات تسجيل الطعام وجد أنها تقدّر الطاقة المتناوَلة بأقل من الواقع بمقدار 202 سعرة حرارية يوميًا في المتوسط (فاصل ثقة 95%: من 319 إلى 85 سعرة).
إذًا تقدير طبق مختلط من صورة غير دقيق. وكذلك أخصائي تغذية ينظر إلى الطبق نفسه، وكذلك إدخاله يدويًا. ما يغيّره التسجيل بالصور ليس الدقة بل ما إذا كنت ستسجّل الوجبة أصلًا، ووجبة مسجّلة بتقدير قابل للتصحيح أفضل من وجبة غير مسجّلة.
كن متشككًا في ادعاءات الدقة
تنشر عدة مواقع أرقام دقة تبدو محددة لتطبيقات السعرات، وبعضها يستشهد بدراسات ومعرّفات DOI غير موجودة. لا يوجد تطبيق لديه تحقق منشور ومُحكَّم لمنتجه المطروح. وحين لا يكون خلف الرقم مجلة محددة وحجم عينة ومنهجية، عامله كتسويق. وهذا يشمل أرقامنا نحن: الأرقام في هذه الصفحة منسوبة إلى بحث مستقل، لا إلى اختبارنا.
هل "قريب بما يكفي" جيد بما يكفي؟
بالنسبة لمعظم الناس، نعم. هامش خطأ من 10 إلى 20% يبدو كبيرًا بمعزل عن السياق، لكن السياق مهم.
الإدخالات اليدوية في قواعد البيانات ليست دقيقة تماماً هي الأخرى. تحتوي قواعد البيانات التي يقدّمها المستخدمون على أخطاء، وتتفاوت تعريفات حجم الحصة بين المصادر، ونادراً ما تطابق الوجبات المنزلية طريقة التحضير الدقيقة التي تفترضها إدخالة قاعدة البيانات. الدقة العملية للتسجيل اليدوي للطعام المنزلي أقل مما يفترضه معظم الناس.
والأهم من ذلك، أن الاتساق أهم من الدقة لأغراض التتبّع. إذا كنت تقارن بين متتبّعات تعتمد على الذكاء الاصطناعي وتطبيقات قواعد البيانات التقليدية، فإن مقارنة VitaCal مقابل MyFitnessPal تتناول الفروق العملية في أسلوب التسجيل. إذا كان الذكاء الاصطناعي يخطئ بشكل منهجي بنسبة 15% في وجبة معينة تتناولها بانتظام، فإن ما تسجّله لا يزال يعكس استهلاكك الفعلي من الناحية النسبية. اتجاهاتك الأسبوعية، واستجاباتك للتغييرات الغذائية، وتقدّمك على مرّ الوقت، كلها تبقى ذات دلالة. هدف التتبّع هو بناء الوعي وتحديد الأنماط، وليس تحقيق قياس بدقة مختبرية لكل وجبة.
ما يكسر التتبع ليس هامش خطأ 15%. ما يكسر التتبع هو ترك العادة لأن التسجيل بطيء أو مجهد. والتسجيل بالصور بالذكاء الاصطناعي يعالج تلك المشكلة مباشرة.
كيف تحصل على نتائج أفضل
بعض العادات البسيطة تحسّن جودة تقديرات الذكاء الاصطناعي لديك:
- راجع ما حدده الذكاء الاصطناعي قبل تأكيد التسجيل. إذا فاته مكوّن أو حدد شيئاً بشكل خاطئ، يمكنك تصحيحه قبل الحفظ.
- التقط الصور من الأعلى مباشرة في إضاءة جيدة. يستغرق ذلك ثانية إضافية ويُحدث فرقًا قابلًا للقياس.
- في الوجبات التي تهمك دقتها، سجّل كل مكوّن على حدة بدل تسجيل الطبق كوحدة واحدة. هذا يعطي النموذج مهمة أوضح لكل صنف.
- استخدم الإدخال اليدوي للأطعمة المعبّأة. إذا وُجد ملصق غذائي، فاستخدمه. واحفظ التسجيل بالذكاء الاصطناعي للوجبات التي يمنحك فيها أفضلية حقيقية: الطعام المطهو، ووجبات المطاعم، وكل ما كنت ستضطر للبحث عنه.
نهج VitaCal
يعرض لك VitaCal بالضبط ما تعرّف عليه الذكاء الاصطناعي في صورتك قبل تسجيل أي شيء. يمكنك رؤية كل صنف طعام وحصته المقدّرة والسعرات والماكروز الناتجة. وإذا بدا شيء غير صحيح، يمكنك تعديل الحصص أو حذف أصناف قبل التأكيد. لا يُسجَّل شيء دون مراجعتك.
تُحذف الصور فور انتهاء التحليل ولا تُرفق أبدًا بوجبتك المحفوظة. صور وجباتك ملك لك.
إذا كنت تريد أن ترى كيف يعمل التسجيل بالذكاء الاصطناعي عملياً، جرّب VitaCal مجاناً. تتضمّن الخطة المجانية خمسة تحليلات بالذكاء الاصطناعي أسبوعياً بدون إعلانات.