Jak dokładne jest rozpoznawanie jedzenia przez AI? Czego się spodziewać
Opublikowano w kwietniu 2026
Rejestrowanie posiłków ze zdjęcia z pomocą AI jest znacznie szybsze niż ręczne przeszukiwanie bazy produktów. Ale przed zmianą aplikacji często pada pytanie: jak dokładne to naprawdę jest? Szczera odpowiedź brzmi: zależy od tego, co jesz i jak to fotografujesz. Oto co ta technologia potrafi, a czego nie.
AI do rozpoznawania jedzenia: jak działa ta technologia
AI do rozpoznawania jedzenia to widzenie komputerowe zastosowane do talerza: model wytrenowany na opisanych zdjęciach jedzenia, który rozpoznaje, co jest na zdjęciu, i szacuje, ile tego jest. Ta sama klasa modeli napędza konsumenckie aplikacje do liczenia kalorii i komercyjne API do rozpoznawania jedzenia, na których budują restauracje, szpitale i platformy zdrowotne. Każda implementacja przechodzi przez te same pięć etapów.
- Wykrywanie. Model znajduje obszary obrazu, na których w ogóle jest jedzenie, i oddziela je od talerza, stołu i tła.
- Segmentacja. Każdy fragment jedzenia jest dzielony na osobne elementy, więc smażone warzywa z mięsem stają się białkiem, warzywami, ryżem i sosem, a nie jednym obiektem.
- Klasyfikacja. Każdy fragment jest dopasowywany do kategorii jedzenia, na których trenowano model. To etap, który jest dziś niezawodny: nowoczesne modele rozpoznają tysiące dań.
- Szacowanie objętości i porcji. Model wnioskuje, ile danego produktu jest obecne, na podstawie jego pozornej wielkości względem talerza, sztućców lub innych obiektów odniesienia. To ten etap, a nie klasyfikacja, jest źródłem niemal wszystkich błędów.
- Wyszukiwanie wartości odżywczych. Każdy rozpoznany produkt jest przeliczany na oszacowaną porcję i dopasowywany do wartości kalorii i makroskładników.
Gdy robisz zdjęcie posiłku, model wizyjny AI analizuje obraz, żeby rozpoznać poszczególne produkty. Bierze pod uwagę kształty, kolory, tekstury i kontekst, żeby ustalić, co jest na talerzu. Po rozpoznaniu produktów system szacuje wielkość porcji na podstawie wskazówek wizualnych, w tym widocznej wielkości każdego elementu względem talerza, sztućców lub innych punktów odniesienia w kadrze.
Na podstawie tych szacunków oblicza kalorie i makroskładniki, korzystając z wartości odżywczych rozpoznanych produktów. Cały proces zwykle trwa kilka sekund.
Jak jest dokładne?
W przypadku popularnych, dobrze widocznych posiłków rozpoznawanie jedzenia przez AI jest dość dokładne. Talerz z piersią z kurczaka, ryżem i warzywami gotowanymi na parze to rodzaj posiłku, z którym AI radzi sobie dobrze. Poszczególne składniki są widoczne, wielkość porcji da się oszacować, a model widział takie produkty wiele razy. Tego, jak blisko oszacowanie trafia, nikt nie może uczciwie sprowadzić do jednej wartości procentowej. Przegląd systematyczny z 2023 roku w Annals of Medicine przejrzał 14 059 publikacji, zachował 52 opublikowane w latach 2010-2023 i wykazał w nich średnie błędy względne dla kalorii od 0,1% do 38,3%. Autorzy nie mogli połączyć tych badań w jedną liczbę, bo bazy zdjęć jedzenia i raportowane wyniki różniły się zbyt mocno, by przeprowadzić metaanalizę. Przegląd ustala natomiast kierunek: błędy były mniejsze na zdjęciach pojedynczych lub prostych produktów.
Dokładność spada w przypadku dań mieszanych. Miska gulaszu, zapiekanka czy curry zawierają składniki częściowo lub całkowicie ukryte. AI rozpozna, co to za danie, ale nie widzi, co jest w środku, więc szacunki opierają się bardziej na typowych przepisach niż na tym, co faktycznie jest w twoim garnku. Zakres błędu się poszerza.
Sosy, oleje i dressingi zawsze sprawiają trudność. Sałatka polana oliwą i sałatka z lekkim winegretem wyglądają na zdjęciu niemal identycznie. Różnica kaloryczna między nimi może być znaczna. Olej dodany na patelnię przed smażeniem jest na końcowym zdjęciu zupełnie niewidoczny.
Produkty pakowane z etykietą wartości odżywczej lepiej wpisać ręcznie lub zeskanować kodem kreskowym. 200-gramowa porcja konkretnego markowego jogurtu ma znany, dokładny profil odżywczy. Szacowanie przez AI wprowadza niepotrzebną niepewność, gdy prawdziwe wartości są wydrukowane na opakowaniu.
Co wpływa na dokładność
Kilka praktycznych czynników wpływa na to, jak dobrze AI radzi sobie z danym zdjęciem:
- Oświetlenie. Dobrze oświetlone zdjęcia dają modelowi więcej informacji wizualnych. Słabe światło spłaszcza tekstury i zmniejsza wierność kolorów, przez co trudniej poprawnie rozpoznać jedzenie.
- Kąt. Zdjęcia z góry (bezpośrednio nad talerzem) zwykle dają najlepsze wyniki. Kąty z boku mogą zasłaniać produkty za innymi i sprawiać, że szacowanie porcji jest mniej wiarygodne.
- Ułożenie jedzenia. Produkty rozłożone na talerzu w osobnych porcjach łatwiej przeanalizować niż ułożone jeden na drugim lub wymieszane. Jeśli jesz kilka rzeczy, rozłożenie ich przed zrobieniem zdjęcia pomaga.
- Obiekty odniesienia. Brzeg talerza, widelec lub inny znajomy przedmiot w kadrze pomaga modelowi skalibrować wielkość porcji. Kawałek kurczaka wygląda zupełnie inaczej w skali obok widelca niż obok niczego.
Posiłki złożone są trudniejsze niż pojedyncze produkty
Grillowana pierś z kurczaka obok ryżu i brokułów to trzy odrębne kształty z wyraźnymi krawędziami. Curry, gulasz, zapiekanka czy sałatka z sosem to jedna wizualna masa, w której składniki na siebie zachodzą, zasłaniają się i mają różną gęstość. AI szacuje ten drugi rodzaj posiłków znacznie mniej dokładnie i jest to najważniejszy pojedynczy czynnik decydujący o tym, czy oszacowanie ze zdjęcia będzie trafne.
Przegląd systematyczny z 2023 roku w Annals of Medicine, obejmujący 52 badania opublikowane w latach 2010-2023, wykazał średnie błędy względne dla kalorii od 0,10% do 38,3% i stwierdził, że błędy „były zwykle mniejsze na zdjęciach pojedynczych produktów niż na zdjęciach wielu produktów”. Wprost wskazuje trudny przypadek: „zdjęcia dań mieszanych (takich jak curry) lub talerzy z różnorodnymi, nachodzącymi na siebie produktami o różnej wysokości lub niewyraźnych granicach niosą większe ryzyko błędów klasyfikacji lub segmentacji”. Spośród 22 najmniejszych błędów szacowania objętości w analizowanych badaniach 68% pochodziło ze zdjęć pojedynczych produktów.
Analiza GPT-4V porównana z ważonymi posiłkami referencyjnymi, opublikowana w IEEE Journal of Biomedical and Health Informatics w 2024 roku, podała liczby dla tej różnicy. Szacowanie jednego produktu naraz, dla 32 produktów, dało średni bezwzględny błąd kaloryczny 69,2 kcal. Szacowanie całego posiłku, dla 10 posiłków, dało 151,2 kcal, mniej więcej dwa razy więcej. Przyczyną jest kumulacja: wielkość porcji to główne źródło błędu, a mieszane danie wymaga osobnej oceny porcji dla każdego składnika, z których każda ma własny błąd.
Ta kwestia nie jest do końca rozstrzygnięta. Badanie z 2025 roku w Nutrients, analizujące 195 dań, wykazało tylko słabą korelację między liczbą składników a błędem (r nie wyższe niż 0,37) i stwierdziło, że liczba składników nie jest decydującym czynnikiem. Uczciwe podsumowanie jest takie, że wizualna rozdzielność ma większe znaczenie niż liczba składników: talerz z sześcioma wyraźnie oddzielonymi produktami jest łatwiejszy niż miska z trzema wymieszanymi.
Co to oznacza w praktyce
- Fotografuj przed wymieszaniem. Zrób zdjęcie składników, gdy są jeszcze oddzielne, a nie wymieszanej miski.
- Podziel mieszany posiłek na dwa zdjęcia tam, gdzie to rozsądnie możliwe. Dwa pojedyncze szacunki są lepsze niż jeden złożony.
- Poprawiaj szacunek wszystkiego, co jest zmiksowane, polane sosem lub warstwowe. Tłuszcz to składnik najczęściej niedoszacowywany we wszystkich badaniach, a olej w sosie jest na zdjęciu niewidoczny.
- Domowe gulasze i curry traktuj jako najgorszy przypadek i zapisuj je ze składników, a nie ze zdjęcia, gdy dany posiłek ma znaczenie.
W porównaniu z czym?
Przydatne porównanie to nie AI kontra idealna liczba, tylko AI kontra inny sposób zapisania tego posiłku, który też jest niedokładny.
W badaniu z 2018 roku opublikowanym w Nutrients poproszono 38 specjalistów od żywienia o oszacowanie porcji na podstawie zdjęć jedzenia. Tylko 23,7% ich szacunków mieściło się w granicach 10% rzeczywistej zważonej ilości, a średnia bezwzględna różnica procentowa wyniosła 47,6%. W pracy Nutrition5k przedstawionej na CVPR 2021 obok zbioru danych liczącego około 5000 dań przeprowadzono mniejszy test z udziałem ludzi: 4 dietetyków i 16 amatorów oceniało 10 dań wybranych jako prostsze od średniej w zbiorze. Dietetycy mylili się średnio o 41%, a amatorzy o 53%. Traktuj to jako rząd wielkości na korzystnej próbie, a nie szacunek dla populacji.
Ręczne zapisywanie w aplikacji ma własny błąd systematyczny, choć mniejszy, niż sugeruje nagłówkowa liczba. Metaanaliza z 2021 roku w Advances in Nutrition, łącząca 11 badań aplikacji do zapisywania diety, wykazała, że zaniżały one spożycie energii średnio o 202 kcal dziennie (95% CI: od 319 do 85 kcal). Większość tej różnicy wynika z tabeli składu żywności, a nie z samego zapisywania: gdy aplikacja i metoda referencyjna korzystały z tej samej tabeli, łączne niedoszacowanie spadło do 57 kcal dziennie (95% CI: od niedoboru 116 kcal do nadwyżki 2 kcal), a heterogeniczność między badaniami spadła do zera. Przy 2000 kalorii dziennie to mniej niż 3%, więc staranne ręczne wprowadzanie przy dopasowanej bazie naprawdę jest dokładniejszą metodą.
Szacowanie mieszanego dania ze zdjęcia jest więc nieprecyzyjne, podobnie jak ocena dietetyka patrzącego na ten sam talerz. Staranne ręczne wprowadzanie wygrywa z obiema metodami pod względem dokładności i przegrywa z nimi pod względem tego, czy wytrwasz w zapisywaniu. Zapisywanie ze zdjęć nie zmienia dokładności, tylko to, czy w ogóle zapiszesz posiłek, a zapisany posiłek z szacunkiem do poprawienia jest lepszy niż niezapisany.
Podchodź sceptycznie do deklaracji dokładności
Kilka serwisów publikuje precyzyjnie brzmiące dane o dokładności aplikacji do liczenia kalorii, niektóre powołując się na badania i numery DOI, które nie istnieją. Żadna aplikacja nie ma opublikowanej, recenzowanej walidacji swojego produktu w obecnej wersji. Jeśli za liczbą nie stoi nazwane czasopismo, wielkość próby i metodologia, traktuj ją jak marketing. Dotyczy to także nas: dane na tej stronie pochodzą z niezależnych badań, a nie z naszych własnych testów.
Czy „wystarczająco blisko” jest wystarczająco dobre?
Dla większości osób tak. Dwucyfrowy margines błędu brzmi poważnie w oderwaniu od kontekstu, ale kontekst ma znaczenie.
Ręczne wpisy z bazy też nie są idealnie dokładne. Bazy tworzone przez użytkowników zawierają błędy, definicje porcji różnią się między źródłami, a posiłki gotowane w domu rzadko odpowiadają dokładnie sposobowi przygotowania założonemu we wpisie w bazie. Rzeczywista dokładność ręcznego wpisywania domowych posiłków jest niższa, niż większość osób zakłada.
Co ważniejsze, przy śledzeniu regularność liczy się bardziej niż precyzja. Jeśli porównujesz aplikacje oparte na AI z tradycyjnymi aplikacjami bazodanowymi, porównanie VitaCal vs MyFitnessPal omawia praktyczne różnice w sposobie zapisywania. Jeśli AI systematycznie myli się o 15% przy konkretnym posiłku, który jesz regularnie, zapisane spożycie nadal względnie odzwierciedla rzeczywiste. Twoje tygodniowe trendy, reakcje na zmiany w diecie i postępy w czasie nadal mają znaczenie. Celem śledzenia jest budowanie świadomości i wychwytywanie wzorców, a nie laboratoryjny pomiar każdego posiłku.
Śledzenie psuje nie margines błędu. Śledzenie psuje porzucenie nawyku, bo rejestrowanie jest zbyt wolne lub zbyt wymagające. Rejestrowanie ze zdjęć z AI rozwiązuje ten problem bezpośrednio.
Jak uzyskać lepsze wyniki
Kilka prostych nawyków poprawi jakość szacunków AI:
- Sprawdź, co rozpoznało AI, zanim zatwierdzisz wpis. Jeśli pominęło składnik lub coś źle rozpoznało, możesz to poprawić przed zapisaniem.
- Rób zdjęcia bezpośrednio z góry przy dobrym oświetleniu. Zajmuje to dodatkową sekundę i daje wymierną różnicę.
- Przy posiłkach, w których liczy się dokładność, zapisuj poszczególne składniki osobno zamiast jednego talerza. Daje to modelowi prostsze zadanie przy każdym produkcie.
- Do produktów pakowanych używaj ręcznego wprowadzania. Jeśli jest etykieta z wartościami odżywczymi, skorzystaj z niej. Zapisywanie z AI zostaw dla posiłków, przy których ma realną przewagę: dań gotowanych, posiłków w restauracji i wszystkiego, czego inaczej musiałabyś szukać w bazie.
Podejście VitaCal
Porównanie zapisywania ze zdjęć w aplikacjach, które je oferują, znajdziesz w przewodniku po licznikach kalorii z AI rozpoznających zdjęcia.
VitaCal pokazuje ci dokładnie, co AI rozpoznało na zdjęciu, zanim cokolwiek zostanie zapisane. Widzisz poszczególne produkty, ich oszacowane porcje oraz wynikające z nich kalorie i makroskładniki. Jeśli coś się nie zgadza, możesz poprawić porcje lub usunąć pozycje przed potwierdzeniem. Nic nie zostaje zapisane bez twojego sprawdzenia.
Jeśli chcesz zobaczyć, jak rejestrowanie przez AI działa w praktyce, wypróbuj VitaCal za darmo. Darmowy plan obejmuje pięć analiz AI tygodniowo bez reklam.