AI食品認識はどれくらい正確か?期待できること
2026年4月公開
AIを活用した食事写真記録は、食品データベースを手動で検索するよりも大幅に速くなります。ただし、乗り換える前によく聞かれるのが「実際のところ、どれだけ正確なのか」という疑問です。正直な答えは、何を食べているか、どう撮影するかによって変わるということです。この技術にできること、できないことを見ていきましょう。
食品認識AI:技術の仕組み
食品認識AIとは、皿の上の料理に応用されたコンピュータービジョンです。ラベル付けされた食品画像で学習されたモデルが、写真に何が写っているかを識別し、その量を推定します。同じ種類のモデルが、消費者向けのカロリーアプリや、飲食店、病院、健康プラットフォームが利用する商用の食品認識APIを支えています。どの実装も同じ5つの段階を経て処理を行います。
- 検出。モデルは画像の中から食品が写っている領域を見つけ出し、皿やテーブル、背景と切り分けます。
- セグメンテーション。それぞれの食品の領域が個別の品目に分けられます。たとえば炒め物は1つの物体ではなく、タンパク質、野菜、ご飯、ソースに分けて認識されます。
- 分類。各セグメントは、モデルが学習した食品カテゴリと照合されます。この段階は現在では信頼性が高く、最新のモデルは数千種類の料理を認識できます。
- 量と分量の推定。モデルは、お皿やカトラリーなどの基準となる物との見た目の大きさの比較から、各品目がどのくらいあるかを推測します。誤差のほとんどは、分類ではなくこの段階で生じます。
- 栄養情報の照合。識別された各食品は推定された分量に合わせてスケーリングされ、カロリーとマクロ栄養素の値と照合されます。
食事の写真を撮ると、AIビジョンモデルが画像を解析し、個々の食品を識別します。形、色、質感、周囲の状況から、皿の上に何があるかを判断します。食品が識別された後、システムは視覚的な手がかり(皿やカトラリー、フレーム内のその他の基準物に対する各食品の見かけの大きさなど)に基づいて分量を推定します。
その推定結果から、識別された食品の栄養価を使ってカロリーとマクロ栄養素を計算します。この一連の処理には通常数秒しかかかりません。
精度はどれくらいか
一般的で見分けやすい食事であれば、AIによる食品認識はかなり正確です。鶏胸肉、ご飯、蒸し野菜が乗った一皿は、AIが得意とするタイプの食事です。個々の構成要素が視認でき、分量も推定しやすく、モデルが何度も学習してきた食品だからです。推定値がどれほど正確かを、正直に一つのパーセンテージにまとめることはできません。2023年にAnnals of Medicine誌に掲載されたシステマティックレビューは14,059件の論文をスクリーニングし、2010年から2023年の間に発表された52件を採用した結果、カロリーの平均相対誤差は0.1%から38.3%まで幅があることがわかりました。著者らは、食品画像データベースと報告された結果のばらつきが大きすぎるためメタ分析で一つの数値に統合できませんでした。このレビューが示しているのは方向性です:単一または単純な食品の画像では誤差が小さくなる、という点です。
混ぜ合わせた料理では精度が下がります。シチューやキャセロール、カレーなどには、一部または完全に見えない材料が含まれています。AIはその料理が何であるかは識別できても、中に何が入っているかまでは見えないため、推定は実際の鍋の中身よりも一般的なレシピに頼る部分が大きくなります。その結果、誤差の幅が広がります。
ソース、油、ドレッシング類は一貫して判定が難しい食品です。オリーブオイルをかけたサラダと、さっぱりしたビネグレットをかけたサラダは、写真ではほとんど見分けがつきません。両者のカロリー差は無視できないことがあります。炒め物の前にフライパンに加える調理油は、完成後の写真には一切写りません。
栄養成分表示のある包装食品は、手動入力やバーコードスキャンで記録する方が適しています。特定ブランドのヨーグルト200gには、既知の正確な栄養成分があります。パッケージに正解が印刷されているのに、AIによる推定を使うと不要な不確実性が生まれます。
精度を左右する要因
AIが特定の写真に対してどの程度うまく機能するかには、いくつかの実践的な要因が影響します。
- 照明。明るい場所で撮影した写真は、モデルがより多くの視覚情報を得られます。照明が悪いと質感が平坦になり、色の正確さも低下するため、食品を正しく識別しにくくなります。
- 角度。真上から撮った写真(お皿の真上)が最も良い結果になりやすいです。横からの角度では、手前の食品に隠れて奥の食品が見えなくなり、分量の推定の信頼性が下がります。
- 食品の並べ方。皿の上で食品が個別に分けて配置されていると、重なったり混ざったりしている場合より分析しやすくなります。複数の料理がある場合は、写真を撮る前に少し離して並べると効果的です。
- 基準となる物。お皿の縁やフォークなど見慣れた物をフレーム内に含めると、モデルが分量を較正しやすくなります。鶏肉の一切れは、フォークの隣に置いた場合と何もない場所に置いた場合とでは、見た目のスケール感が大きく異なります。
混ざった料理は単品より難しい
グリルした鶏胸肉、ご飯、ブロッコリーが並ぶ皿は、輪郭のはっきりした3つの独立した形状です。一方、カレー、シチュー、キャセロール、ドレッシングをかけたサラダは、構成要素が重なり合い、互いに隠れ合い、密度もさまざまな一つの塊として見えます。AIは後者のタイプの推定精度が大きく下がり、これが写真からの推定値がどれだけ近いかを左右する最大の要因です。
2010年から2023年にかけて発表された52件の研究を対象とした、Annals of Medicine誌の2023年のシステマティックレビューでは、カロリーの平均相対誤差は0.10%から38.3%に及び、誤差は「複数の食品が写った画像よりも、単一の食品が写った画像のほうが小さい傾向にあった」と報告されています。同レビューは、難易度の高いケースについて明確に指摘しています。「(カレーのような)混ざり合った料理や、高さの異なる食品が重なり合っていたり境界が不明瞭だったりする皿は、分類やセグメンテーションの誤りのリスクが高くなる」。対象研究全体における量推定誤差が最も小さかった22件のうち、68%は単一食品の画像によるものでした。
2024年にIEEE Journal of Biomedical and Health Informatics誌に掲載された、計量済みの基準食事に対するGPT-4Vの分析は、この差を数値化しました。食品を1点ずつ推定した場合、32点にわたる平均絶対カロリー誤差は69.2 kcalでした。食事全体をまとめて推定した場合、10エピソードにわたる誤差は151.2 kcalと、ほぼ倍になりました。原因は誤差の積み重ねにあります。分量の推定が誤差の主な要因であり、混合料理では構成要素ごとに個別の分量判断が必要になり、それぞれが独自の誤差を持つためです。
これは完全には決着していません。195品の料理を分析した2025年のNutrients誌の研究では、食材数と誤差の間には弱い相関しか見られず(rは0.37以下)、構成要素の数が決定的な要因ではないと結論づけています。率直に言えば、視覚的な分離しやすさのほうが食材数よりも重要です。6種類の食品がはっきりと分かれて盛られた皿は、3種類が混ざり合ったボウルよりも認識しやすいのです。
それが実際に意味すること
- 混ぜる前に撮影します。かき混ぜたボウルではなく、まだ具材が分かれている状態で撮影しましょう。
- 混ざった料理は、できるときは2枚の写真に分けて撮りましょう。1枚でまとめて推定するより、単品で2回推定したほうが正確です。
- 混ぜ合わされたもの、ソースがかかっているもの、層になっているものは推定値を補正しましょう。脂質はどの研究でも一貫して過小評価されやすい栄養素であり、ソースに含まれる油は写真では見えません。
- 自家製のシチューやカレーは最も判定が難しいケースとして扱い、重要な食事のときは写真ではなく材料から記録しましょう。
何と比較して?
本当に意味のある比較は、AIと完璧な数値との比較ではなく、AIとそれ以外の方法で記録した場合(それもまた不正確な方法です)との比較です。
2018年にNutrients誌に掲載された研究では、栄養の専門家38人に食品画像から分量を推定してもらいました。実際に計量した量の10%以内に収まった推定は全体のわずか23.7%で、平均絶対誤差率は47.6%でした。CVPR 2021で発表されたNutrition5kの研究では、約5,000品の料理データセットに加えて小規模な人間による検証も行われ、栄養士4人とアマチュア16人が、データセットの平均より単純な料理10品を評価しました。栄養士の平均誤差は41%、アマチュアは53%でした。これは母集団全体の推定値としてではなく、好条件のサンプルにおける桁数の目安として読むべき数字です。
手動でのアプリ入力にも、それ自体の誤差はありますが、見出しの数字が示すほど大きくはありません。Advances in Nutrition誌に掲載された2021年のメタ分析は、食事記録アプリに関する11件の研究をまとめ、平均で1日あたり202 kcal(95%信頼区間:319〜85 kcal)のエネルギー摂取量の過小評価を報告しました。その差の大部分は記録そのものではなく食品成分表に由来するもので、アプリと基準となる方法が同じ成分表を使っている場合、平均の差は1日あたり57 kcal(95%信頼区間:116 kcalの過小評価〜2 kcalの過大評価)まで縮まり、研究間のばらつきもゼロになりました。1日2,000カロリーで見ればこれは3%未満であり、対応する成分表に照らして丁寧に手動入力すれば、実際により正確な方法になり得るということです。
つまり、混ざり合った料理を写真で推定するのは不正確で、それは同じ皿を見る管理栄養士も同様です。丁寧な手動入力は精度の面ではどちらにも勝りますが、続けられるかという点ではどちらにも劣ります。写真ロギングが変えるのは精度ではなく、そもそも食事を記録するかどうかです。修正可能な推定値付きで記録された食事は、記録されなかった食事に勝ります。
精度に関する主張は鵜呑みにしない
多くのサイトが、カロリーアプリについて正確そうに見える精度の数値を公開していますが、中には存在しない研究やDOIを引用しているものもあります。実際に配信されている製品について、査読済みの検証結果を公開しているアプリはありません。ある数値の背後に、明示された学術誌、サンプルサイズ、方法論がない場合は、それをマーケティングとして扱うべきです。これは当社にも当てはまります。このページに記載されている数値は、当社独自のテストではなく、独立した研究を引用したものです。
「だいたい合っている」で十分?
多くの人にとっては、はい、使えます。二桁の誤差率は単独で見ると大きく思えますが、文脈が重要です。
手動でのデータベース入力も完全に正確とは言えません。ユーザー投稿型のデータベースには誤りが含まれており、1食分の定義も情報源によって異なり、家庭料理はデータベースが想定する調理法と一致しないことがほとんどです。家庭料理の手動記録の実用的な精度は、多くの人が思っているより低いのが実情です。
さらに重要なのは、記録の目的においては精度よりも一貫性の方が重要だという点です。AIベースのトラッカーと従来型のデータベースアプリを比較しているなら、VitaCal対MyFitnessPalの比較で記録方法の実際の違いを確認できます。よく食べる特定の食事についてAIが常に15%ずれていたとしても、記録された摂取量は相対的には実際の摂取量を反映しています。週ごとの傾向、食事の変化への反応、時間をかけた進捗は、いずれも十分に意味があります。記録の目的は、すべての食事を実験室レベルで測定することではなく、意識を高めパターンを把握することです。
記録が続かなくなる原因は誤差の大きさではありません。記録が遅すぎたり手間がかかりすぎたりして、習慣自体をやめてしまうことが原因です。AI写真記録はこの問題に直接対処します。
より良い結果を得る方法
いくつかの簡単な習慣で、AIによる推定の精度は向上します。
- 記録を確定する前に、AIが認識した内容を確認してください。食材が見落とされていたり、誤って認識されていたりした場合は、保存前に修正できます。
- 明るい場所で、真上から写真を撮りましょう。ほんの1秒余分にかかるだけですが、はっきりとした違いが出ます。
- 精度が重要な食事では、1枚の皿としてではなく、個々の構成要素を分けて記録してください。そうすることで、モデルは各アイテムをよりシンプルなタスクとして扱えます。
- 包装食品には手動入力を使ってください。栄養成分表示があるなら、それを使いましょう。AI記録は、調理済みの料理、外食、検索が必要になるような食品など、本当に強みが発揮される場面に使うのが得策です。
VitaCalのアプローチ
写真ログに対応する各アプリでの比較については、AIカロリートラッカーの写真認識アプリガイドをご覧ください。
VitaCalは、何かが記録される前に、写真からAIが何を識別したかを正確に表示します。個々の食品、その推定分量、そして結果として算出されるカロリーとマクロを確認できます。何かがおかしいと感じたら、確定する前に分量を調整したり項目を削除したりできます。確認なしに記録されることはありません。
AI記録が実際にどのように機能するかを試してみたい場合は、VitaCalを無料で試すことができます。無料プランには広告なしで週5回のAI解析が含まれています。