Jak přesné je rozpoznávání jídla pomocí AI? Co očekávat
Publikováno v dubnu 2026
Zapisování jídel z fotek pomocí AI je výrazně rychlejší než ruční hledání v databázi potravin. Častá otázka před přechodem ale zní: jak přesné to doopravdy je? Upřímná odpověď je, že záleží na tom, co jíš a jak to fotíš. Tady je, co technologie umí a co ne.
AI pro rozpoznávání jídla: jak technologie funguje
AI pro rozpoznávání jídla je počítačové vidění použité na talíř: model natrénovaný na označených obrázcích jídla, který pozná, co je na fotografii, a odhadne, kolik toho je. Stejná třída modelů pohání spotřebitelské aplikace na počítání kalorií i komerční API pro rozpoznávání jídla, na kterých stavějí restaurace, nemocnice a zdravotnické platformy. Každá implementace prochází stejnými pěti fázemi.
- Detekce. Model najde oblasti snímku, které vůbec obsahují jídlo, a oddělí je od talíře, stolu a pozadí.
- Segmentace. Každá oblast s jídlem se rozdělí na jednotlivé položky, takže smažené jídlo z wok pánve se stane bílkovinou, zeleninou, rýží a omáčkou místo jednoho objektu.
- Klasifikace. Každý segment se porovná s kategoriemi potravin, na kterých byl model natrénován. Tahle fáze je dnes spolehlivá: moderní modely rozpoznají tisíce pokrmů.
- Odhad objemu a porce. Model odvozuje množství každé položky z její zdánlivé velikosti vůči talíři, příboru nebo jiným referenčním objektům. Právě z této fáze, ne z klasifikace, pochází téměř veškerá chyba.
- Vyhledání výživových hodnot. Každá rozpoznaná potravina se přepočítá na odhadnutou porci a přiřadí se jí hodnoty kalorií a makroživin.
Když vyfotíš jídlo, AI model počítačového vidění obrázek analyzuje a určí jednotlivé potraviny. Sleduje tvary, barvy, textury a kontext, aby zjistil, co je na talíři. Jakmile jsou potraviny rozpoznané, systém odhadne velikost porcí podle vizuálních vodítek, včetně zdánlivé velikosti každé položky vůči talíři, příboru nebo jiným referenčním bodům v záběru.
Z těchto odhadů pak vypočítá kalorie a makroživiny na základě nutričních hodnot identifikovaných potravin. Celý proces obvykle trvá pár sekund.
Jak je to přesné?
U běžných, jasně viditelných jídel je rozpoznávání potravin pomocí AI přiměřeně přesné. Talíř s kuřecím prsem, rýží a dušenou zeleninou je typ jídla, u kterého AI funguje dobře. Jednotlivé složky jsou viditelné, velikost porcí lze odhadnout a jde o potraviny, které model už mnohokrát viděl. Jak přesný odhad je, nelze poctivě zredukovat na jedno jediné procento. Systematický přehled z roku 2023 v časopise Annals of Medicine prošel 14 059 publikací, z nichž ponechal 52 vydaných mezi lety 2010 a 2023, a zjistil, že se průměrné relativní chyby u kalorií pohybovaly od 0,1 % do 38,3 %. Autoři nemohli tyto studie sloučit do jednoho čísla, protože databáze fotografií jídel i uváděné výsledky se lišily příliš na to, aby šla provést metaanalýza. Co přehled ukazuje jasně, je směr: u fotografií jednoduchých nebo jednosložkových jídel byly chyby nižší.
U míchaných pokrmů přesnost klesá. Miska guláše, zapékané jídlo nebo kari obsahují ingredience, které jsou částečně nebo úplně skryté. AI dokáže určit, o jaký pokrm jde, ale nevidí, co je uvnitř, takže odhady se víc opírají o typické recepty než o to, co je skutečně ve tvém hrnci. Rozptyl chyby se zvětšuje.
Omáčky, oleje a dresinky jsou vždy obtížné. Salát ochucený olivovým olejem a salát s lehkým vinaigrette vypadají na fotce skoro stejně. Rozdíl v kaloriích mezi nimi ale může být výrazný. Kuchyňské oleje přidané do pánve před osmažením jsou na výsledné fotce úplně neviditelné.
Balené potraviny s nutričními údaji je lepší zapsat ručně nebo naskenováním čárového kódu. 200g porce konkrétního značkového jogurtu má známé a přesné nutriční složení. Odhad pomocí AI přináší zbytečnou nejistotu, když je skutečná hodnota vytištěná na obalu.
Co ovlivňuje přesnost
To, jak dobře si AI poradí s konkrétní fotkou, ovlivňuje několik praktických faktorů:
- Osvětlení. Dobře osvětlené fotky dávají modelu víc vizuálních informací. Špatné světlo zplošťuje textury a snižuje věrnost barev, takže se jídlo hůř správně rozpoznává.
- Úhel. Fotky shora (přímo nad talířem) obvykle dávají nejlepší výsledky. Boční úhly mohou skrýt potraviny za jinými a znepřesnit odhad porce.
- Uspořádání jídla. Potraviny rozložené na talíři v oddělených porcích se analyzují snadněji než naskládané nebo smíchané. Pokud máš víc položek, pomůže je před vyfocením rozložit.
- Referenční objekty. Zahrnutí okraje talíře, vidličky nebo jiného známého předmětu do záběru pomáhá modelu kalibrovat velikost porce. Kousek kuřete vypadá měřítkem úplně jinak vedle vidličky než vedle ničeho.
Smíšená jídla jsou náročnější než jednotlivé potraviny
Grilované kuřecí prso vedle rýže a brokolice jsou tři odlišné tvary s jasnými okraji. Kari, guláš, zapékaný pokrm nebo salát s dresinkem je jedna vizuální hmota, kde se složky překrývají, navzájem skrývají a liší se hustotou. AI odhaduje druhý typ výrazně méně přesně a je to jednoznačně nejsilnější prediktor toho, zda bude odhad z fotky blízko realitě.
Systematický přehled z roku 2023 v časopise Annals of Medicine, který pokrývá 52 studií publikovaných mezi lety 2010 a 2023, zjistil průměrné relativní chyby u kalorií v rozmezí od 0,10 % do 38,3 % a uvedl, že chyby „bývaly menší u fotek jednoho jídla ve srovnání s fotkami s více jídly“. Přímo vymezuje obtížný případ: „fotky se smíchanými pokrmy (jako jsou kari) nebo talíře s řadou překrývajících se potravin různých výšek nebo s nejasnými hranicemi představují vyšší riziko chyb v klasifikaci nebo segmentaci“. Z 22 nejnižších chyb odhadu objemu napříč zkoumanými studiemi jich 68 % pocházelo z fotek jednoho jídla.
Analýza GPT-4V oproti váženým referenčním jídlům, publikovaná v IEEE Journal of Biomedical and Health Informatics v roce 2024, dala tomuto rozdílu čísla. Odhad jedné potraviny najednou, napříč 32 položkami, přinesl průměrnou absolutní chybu 69,2 kcal. Odhad celého jídla najednou, napříč 10 epizodami, přinesl 151,2 kcal, zhruba dvojnásobek. Příčina je kumulativní: velikost porce je dominantním zdrojem chyby a smíšené jídlo vyžaduje samostatný odhad porce pro každou součást, přičemž každá nese vlastní chybu.
Toto není zcela vyřešené. Studie z roku 2025 v časopise Nutrients, která analyzovala 195 pokrmů, zjistila jen slabou souvislost mezi počtem ingrediencí a chybou (r nejvýše 0,37) a došla k závěru, že počet složek není klíčovým faktorem. Poctivé shrnutí zní, že víc než počet ingrediencí záleží na vizuální oddělenosti: talíř se šesti zřetelně oddělenými potravinami je snazší než miska se třemi smíchanými.
Co to v praxi znamená
- Vyfoť před promícháním. Vyfoť složky, dokud jsou ještě oddělené, ne rozmíchanou misku.
- Smíšené jídlo rozděl do dvou fotek, kde to rozumně jde. Dva jednotlivé odhady jsou lepší než jeden souhrnný.
- Oprav odhad u všeho mixovaného, s omáčkou nebo vrstveného. Tuk je živina, která je ve všech studiích nejsoustavněji podhodnocována, a olej v omáčce na fotce není vidět.
- Domácí guláše a curry ber jako nejhorší případ a při jídlech, na kterých záleží, je zapisuj podle ingrediencí místo podle fotky.
Ve srovnání s čím?
Užitečné srovnání není AI proti dokonalému číslu, ale AI proti tomu, jak bys jídlo jinak zapsala, což je taky nepřesné.
Studie z roku 2018 v časopise Nutrients požádala 38 odborníků na výživu, aby odhadli porce z fotografií jídel. Jen 23,7 % jejich odhadů talířů se vešlo do 10 % skutečné navážené hmotnosti, s průměrnou absolutní procentní odchylkou 47,6 %. Práce Nutrition5k představená na CVPR 2021 provedla vedle svého datového souboru zhruba 5 000 jídel menší lidskou kontrolu: 4 nutriční specialisté a 16 amatérů hodnotili 10 jídel vybraných tak, aby byla jednodušší než průměr souboru. Nutriční specialisté měli průměrnou chybu 41 % a amatéři 53 %. Ber to jako řádový odhad na příznivém vzorku, ne jako odhad pro celou populaci.
Ruční zápis v aplikaci má vlastní zkreslení, i když menší, než naznačuje hlavní číslo. Metaanalýza z roku 2021 v časopise Advances in Nutrition, která spojila 11 studií aplikací pro záznam stravy, zjistila, že v průměru podhodnocují energetický příjem o 202 kcal denně (95% CI: 319 až 85 kcal). Většina tohoto rozdílu jde na vrub tabulky složení potravin, ne samotnému zápisu: tam, kde aplikace a referenční metoda používaly stejnou tabulku, klesl souhrnný rozdíl na 57 kcal denně (95% CI: schodek 116 kcal až přebytek 2 kcal) a rozptyl mezi studiemi klesl na nulu. Při dni s 2 000 kaloriemi je to méně než 3 %, takže pečlivý ruční zápis proti odpovídající databázi je skutečně přesnější metoda.
Odhad smíšeného jídla z fotky je tedy nepřesný, a stejně tak dietolog, který se dívá na stejný talíř. Pečlivé ruční zadávání obojí překoná v přesnosti a s oběma prohraje v tom, zda v něm vytrváš. Zapisování z fotek nemění přesnost, ale to, zda jídlo vůbec zapíšeš, a zapsané jídlo s opravitelným odhadem je lepší než nezapsané.
Buď skeptická k tvrzením o přesnosti
Několik webů zveřejňuje přesně znějící čísla přesnosti pro aplikace na počítání kalorií, některé citují studie a DOI, které neexistují. Žádná aplikace nemá zveřejněnou, recenzovanou validaci svého skutečně vydávaného produktu. Kde za číslem nestojí jmenovaný časopis, velikost vzorku a metodologie, ber to jako marketing. Platí to i pro nás: čísla na této stránce odkazují na nezávislý výzkum, ne na naše vlastní testování.
Stačí „dost blízko“?
Pro většinu lidí ano. Dvoumístná míra chyby zní sama o sobě významně, ale záleží na kontextu.
Ani ruční záznamy z databáze nejsou dokonale přesné. Databáze plněné uživateli obsahují chyby, definice porcí se mezi zdroji liší a jídla uvařená doma málokdy odpovídají přesně tomu způsobu přípravy, se kterým databázový záznam počítá. Skutečná přesnost ručního zapisování u domácí kuchyně je nižší, než si většina lidí myslí.
Důležitější je, že pro účely sledování má konzistence větší význam než přesnost. Pokud porovnáváš trackery založené na AI s tradičními databázovými aplikacemi, srovnání VitaCal a MyFitnessPal se věnuje praktickým rozdílům v přístupu k zapisování. Pokud je AI u konkrétního jídla, které jíš pravidelně, systematicky mimo o 15 %, tvůj zapsaný příjem přesto v relativních číslech odráží tvůj skutečný příjem. Tvoje týdenní trendy, reakce na změny stravy a pokrok v čase mají i tak smysl. Cílem sledování je budovat povědomí a rozpoznávat vzorce, ne dosáhnout laboratorní přesnosti u každého jídla.
Sledování nerozbíjí míra chyby. Sledování rozbíjí opuštění návyku, protože zapisování je příliš pomalé nebo namáhavé. Zapisování z fotek pomocí AI řeší tento problém přímo.
Jak dosáhnout lepších výsledků
Několik jednoduchých návyků zlepší kvalitu odhadů AI:
- Před potvrzením záznamu zkontroluj, co AI rozpoznala. Pokud vynechala nějakou surovinu nebo něco špatně rozpoznala, můžeš to před uložením opravit.
- Foť z kolmého úhlu shora a při dobrém osvětlení. Zabere to o vteřinu navíc a udělá to měřitelný rozdíl.
- U jídel, kde záleží na přesnosti, zapisuj jednotlivé součásti zvlášť místo jako jeden talíř. Model tak dostane pro každou položku čistší úkol.
- U balených potravin používej ruční zadávání. Pokud je k dispozici nutriční štítek, použij ho. AI zapisování si nech pro jídla, kde má skutečnou výhodu: vařená jídla, jídla v restauraci a cokoli, co bys jinak musela vyhledávat.
Přístup VitaCal
Jak si zápis podle fotek vede napříč aplikacemi, které ho nabízejí, se dozvíš v průvodci AI aplikacemi pro rozpoznávání jídla podle fotek.
VitaCal ti přesně ukáže, co AI na tvé fotce identifikovala, než se cokoli zapíše. Vidíš jednotlivé potraviny, jejich odhadované porce a výsledné kalorie a makroživiny. Pokud něco nesedí, můžeš porce upravit nebo položky odebrat před potvrzením. Nic se nezapíše bez tvé kontroly.
Pokud chceš vidět, jak zapisování pomocí AI funguje v praxi, vyzkoušej VitaCal zdarma. Bezplatná verze zahrnuje pět AI analýz týdně bez reklam.