韓国・米国30ブランド、現地サイトと日本向けサイトの「AI設定」は同じか|robots.txt・hreflang・JSON-LD実測

「AI クローラーの設定は本社で済ませた。日本のサイトも同じはずだ」。そう考えるのは自然です。けれど robots.txt は、国単位でも会社単位でもなく、ホスト単位のファイルです。現地向けと日本向け、二つのファイルを並べて開くと何が見えるのか。30組で確かめました。
日本に進出した韓国・米国ブランド30組について、現地サイトと日本向けサイトの robots.txt・hreflang・JSON-LD を2026年9月28日に1回取得し、並べて比べました。robots.txt の AI ボット記述を比べられたのは、ホストが別で両側とも取得できた15組です。表記が一致したのは10組、一致しなかったのは5組。ただし一致した10組のうち、両側に AI ボットの記述があったのは Amazon だけでした。現地と日本のページが互いを指し合う hreflang の相互指定は、両側のトップページを取得できた15組のうち2組で確認できました。
KEY POINTS
| 項目 | 実測結果(2026年9月28日・1回・30組) |
|---|---|
| 比べられた組数 | robots.txt は30組中15組。取得に失敗した7組と、現地と日本が同じホストにある経路型の8組を除いた数 |
| robots.txt の AI ボット記述 | 15組中、一致10組・不一致5組。表記の比較であって、AI ボットが実際に入れるかどうかの比較ではない |
| 同じホストの経路型 | 8組は現地と日本が物理的に同じ robots.txt。国ごとに書き分けるファイルがそもそもない |
| AI ボットを1つも書いていないホスト | 取得できた42ホスト中29ホスト。確認した AI ボット名15種のどれも User-agent 行にない |
| hreflang の相互指定 | 両側のトップページを取得できた15組中2組。両側とも0個が11組(HTML と HTTP ヘッダのみ。サイトマップと JS 挿入分は対象外) |
| Product 構造化データ | 日本側トップページ24件で0件。同じ商品のページを特定できた3組は、両側とも Product あり |
30組を並べて、比べられたのは15組
分母を削ったのは、サイトの置き方と取得の失敗です。
対象は、日本に公式サイトを持つ韓国ブランド15と米国ブランド15。業種はビューティー、ファッション、飲食、小売・EC、IT・家電、自動車を混ぜています。日本向けサイトの置き方は三通りありました。現地とは別のドメイン、サブドメイン、そして同じホストの /jp/ のような経路です。
取得は2026年9月28日 9時06分から9時12分(日本時間)の1回だけ。日本の回線から、Chrome のブラウザ UA で、ログインなしの GET を送りました。JavaScript は実行していません。確認した AI ボット名は GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot、Google-Extended、Applebot-Extended、CCBot など15種です。
ここで分母が減ります。robots.txt を取得できなかったホストが10あり、どれも HTTP 403 でした。60秒おいて1回だけ再試行しても、戻ったホストはゼロ。片側でも取れなかった組は比較から外したので、7組が落ちています。
さらに8組は、現地と日本が同じホストの上にあります。GENTLE MONSTER、Samsung、Hyundai Motor、Coca-Cola、Nike、Apple、Microsoft、Salesforce。この形の robots.txt は物理的に1ファイルなので、「一致か不一致か」を問う意味がない。残った15組が比べる対象です。
分類にも注記を一つ。NEXON は持株会社の本社が東京にあります。今回は創業地で韓国ブランドに数えましたが、この分類には議論の余地があります。
「一致」した10組、AI ボットを書いていたのは Amazon だけ
一致の中身は、ほとんどが「どちらも何も書いていない」だった。
一致した組の顔ぶれは innisfree、LANEIGE、TIRTIR、MISSHA、SAMYANG(ブルダック)、NEXON、Starbucks、Shake Shack、Amazon、Costco。Amazon を除けば、現地も日本も15種のどれにも触れていない組です。
Amazon は amazon.com・amazon.co.jp の両方で、確認した15種のうち12種に全面的な Disallow を書いていて、この部分は一致します。ただ User-agent: * のグループを見ると、Disallow の行は amazon.com が118行、amazon.co.jp が174行。ファイルとしては別物です。今回の「一致」は、AI ボット15種の行だけを比べた結果です。
Costco の一致には、もう一段の注意が要ります。costco.co.jp/robots.txt は HTTP 200 を返しますが、中身は HTML(<title>Costco</title>)でした。今回の判定規則では規則なしとして扱い、AI ボットの記述がない costco.com と「一致」に数えています。「200 OK なのに中身は HTML」は、llms.txt の実測でも見た形です。
範囲を広げても景色は変わりません。取得できた42ホストのうち29ホストは、15種のどれも User-agent 行に書いていませんでした。1種以上を書いていたのは13ホスト。Cloudflare の管理ブロックの目印や Content-Signal の行は、取得できたどのホストにもありませんでした。
AI ボット名がないサイトにも、AI ボットに効く規則はあります。Google の仕様書は、クローラーごとに有効なグループは一つだと書いています。
"Only one group is valid for a particular crawler."
Google Search Central「How Google Interprets the robots.txt Specification」
選ばれるのは、そのクローラーに最も具体的に一致する User-agent のグループです。自分の名前のグループがなければ、User-agent: * のグループに従う。29ホストでは、検索エンジン向けに書いた * の規則が、そのまま AI ボットの規則として読まれる形になっています。
不一致の5組、違い方は一つではない
NONGSHIM|書き方は正反対、入口はどちらも開いている可能性
表記は正反対。それでも、両側とも AI ボットを広く通す書き方に読めます。
韓国の nongshim.com は冒頭で「# Default: Block all bots」とコメントし、User-agent: * に Disallow: / を置きます。その上で「# Trusted AI Crawlers」の見出しの下に、確認した15種のうち11種を並べて Allow: / を与えている。まず全部を閉じ、名簿のボットだけを開ける書き方です。
日本の nongshim.co.jp は AI ボット名がゼロ。User-agent: * に Disallow: /wp-admin/ があるだけの、WordPress の標準的な構成です。先の仕様に従えば、AI ボットはこの * のグループに従うので、閉じているのは /wp-admin/ だけになります。「不一致」は表記の上の話です。実際に通れるかは WAF や CDN の設定次第で、今回は測っていません。
ETUDE|本国は AI ボットを明示、日本は * に任せる
韓国の etude.com は冒頭に「# Optimized for GEO (Generative Engine Optimization)」と書き込んでいます。GPTBot や ClaudeBot など、15種中7種に Allow: / を並べた構成。日本の etude.jp は AI ボットを名指しせず、User-agent: * のグループが Allow: / から始まる構成でした。表記は違っても、日本側の robots.txt にサイト全体を閉じる行はありません。
LG Electronics|日本向けページの規則は、複数の国で共有する1ファイルにある
韓国の lge.co.kr は15種中10種を User-agent 行に書いています。「# Allow AI Search / LLM Bots」などの見出しの下で、/shop/ や /add-to-cart/ などを Disallow にした上で Allow: / を与える形です。日本向けページは lg.com の /jp/ 配下にあり、効いている robots.txt は lg.com のものです。そこには「# Crawl policy is managed in the User-agent: * group.」とあり、AI ボット名はゼロ。/us/ で始まる経路の Disallow も並ぶ、複数の国で共有するファイルでした。
この形だと、日本向けの規則もこのファイルに書き足すことになる。変えるには、ファイルを管理する部署との調整が要ります。
Kiehl's|日本側のほうが AI ボットを明示している
逆向きの例もありました。日本の kiehls.jp は GPTBot や ClaudeBot など15種中8種に Allow を明示し、米国の kiehls.com の robots.txt には、AI ボットの行が一行もありません。「本国が先に整え、日本が後を追う」という図式は、ここでは当てはまらない。
MUSINSA|名簿型どうしでは、名簿の差が扱いの差になり得る
NONGSHIM とは逆に、ここでは名簿の差がそのまま扱いの差になる。
韓国の musinsa.com(15種中12種)と、日本向けページを置く global.musinsa.com(同11種)は、どちらも許可するボットを名簿で並べ、最後に User-agent: * で Disallow: / を置いています。CCBot と Amazonbot は本国の名簿にだけあり、Applebot-Extended は日本側の名簿にだけある。
名簿にないボットは * の Disallow: / に落ちます。表記の上では、CCBot は韓国では名簿に載って Allow: / の対象、日本側では * の Disallow: / に落ちる。名簿が一つずれるだけで、そのボットの入口が片側だけ閉じる書き方です。
国籍別に見ると、比べられた韓国10組は一致6・不一致4、米国5組は一致4・不一致1でした。米国は取得失敗が5組、経路型が5組あり、比べられた組が少ない。この数は、国籍の差を語るには小さすぎます。
hreflang の相互指定、確認できたのは2組
相互指定がそろったのは、どちらも同じホストの経路型でした。別ホストの組では、相互指定は確認できていません。
hreflang は、同じ内容の言語違い・地域違いのページを検索エンジンに伝える仕組みです。Google はその目的をこう説明しています。
"Doing so will help Google Search point users to the most appropriate version of your page by language or region."
Google Search Central「Tell Google about localized versions of your page」
条件は双方向であること。片側だけの指定は無視されます。
"If two pages don't both point to each other, the tags will be ignored."
Google Search Central「Tell Google about localized versions of your page」
両側のトップページを取得できたのは15組です。robots.txt の15組とは顔ぶれが違います。外れたのは、日本の回線から開くと現地ページが日本側へ転送された組(ETUDE、MUSINSA、Nike、Salesforce)と、どちらかのページを取得できなかった組でした。
現地から日本、日本から現地の両方向がそろっていたのは GENTLE MONSTER と Apple。両側とも hreflang が1つもなかったのは11組でした。日本側だけで数えると、取得できた24ページのうち hreflang を1つでも持っていたのは5ページです。
この「0個」は、トップページの HTML の <link> と HTTP ヘッダに無かった、という意味にとどまります。Google は HTML・HTTP ヘッダ・サイトマップの三つを同等の方法として挙げており、サイトマップで宣言しているサイトは今回の数字に出てきません。JavaScript で後から挿入される hreflang も拾えていない。Google 自身、何もしなくても別の言語版を見つけることはある、とも書いています。ここにある数字は、トップのソースを開いて見える範囲の記録です。
Product 構造化データは、トップではなく商品ページで見る
日本側のトップページを取得できたのは24件。そのうち JSON-LD のブロックを持っていたのは21件で、@type は Organization が13件、WebSite が11件、Product は0件でした。トップページに Product がなくても、商品ページにはあり得る。Product の有無を問うなら、見る場所は商品ページです。
そこで、現地と日本で同じ商品のページを測定前に特定できた組だけ、商品ページも取得しました。特定できたのは TIRTIR、GENTLE MONSTER、Apple の3組で、どれも両側に Product がありました。残る27組は、トップページのリンクから同じ商品を突き合わせられず、測れていません。
@type は文字列の完全一致で数えました。日本側には "Website" と書いたページがあり(MISSHA、LG)、WebSite の件数には入れていない。
問うべきは「現地と同じか」ではなく、日本向けのファイルを誰が書き換えられるか
答えが書いてあるのは、日本向けホストのファイルです。
robots.txt が効く範囲について、Google の仕様書は短く書いています。
"A robots.txt on a subdomain is only valid for that subdomain."
Google Search Central「How Google Interprets the robots.txt Specification」
別ドメインや別サブドメインの日本向けサイトに、現地のファイルは届かない。前回の記事で整理した理屈です。今回の実測では、その理屈が現場の差になって出ていました。不一致の5組には、現地側だけが AI ボットを明示している例(NONGSHIM、ETUDE、LG)も、日本側だけが明示している例(Kiehl's)も、両側が別々の名簿を持つ例(MUSINSA)もある。
経路型の8組は反対に、現地と日本が必ず同じファイルです。本社が AI ボットの行を1行変えれば、同じ変更が日本向けページにも及びます。
日本向けのページに効いている robots.txt はどれか。その1ファイルを誰が書き換えられるか。確かめるべきはそこです。別ホストなら日本側に書き手が要る。経路型なら、現地の書き手の判断が日本にもそのまま及ぶ。どちらの形でも、確かめる場所は日本向けホストの /robots.txt です。
この実測で言えること、言えないこと
数字はすべて、下の条件つきで読んでください。
- 測定は1回です。増えた・減ったといった時間の変化は語れません。
- ブラウザの UA で、日本の回線から取得しました。GPTBot や ClaudeBot が実際の UA と IP で受け取る応答とは違い得る。403 だった10ホストが AI クローラーにも 403 を返すかは分かりません。
- robots.txt は表記だけを見ています。WAF や CDN の段階でのブロックは測っていません。
- JavaScript は実行していないため、後から挿入される hreflang・JSON-LD は数に入っていません。サイトマップの hreflang も対象外です。
- 30組は、日本の公式サイトが実在することを確かめて選んだ標本で、無作為抽出ではありません。
日本向けサイトの担当者が今週やること
- 日本向けホストの /robots.txt を現地と並べて開く:見るのは AI ボット名の User-agent 行と、User-agent: * のグループ。AI ボット名がなければ、* の規則が AI ボットにも適用されます。HTTP 200 で HTML が返ってきていないかも、ここで分かる。
- 自社が「別ホスト」か「経路型」かを本社と共有する:別ホストなら、日本側のファイルを誰が更新するかを決める。経路型なら、現地で robots.txt を変える前に日本側へ知らせる段取りを作る。
- hreflang はトップのソースだけで判断しない:HTML、HTTP ヘッダ、サイトマップのどこで宣言しているかを確かめ、現地から日本、日本から現地の両方向がそろっているかを見る。
- 構造化データは商品ページで確かめる:同じ商品の現地ページと日本ページを1組選び、両方の Product の有無を比べる。トップページだけを見ると、今回の日本側24件のように全件0件に見えます。
次は AI クローラー自身の UA で測る
今回の取得スクリプトと判定規則は保存してあり、同じ30組を同じ条件で測り直せます。次に知りたいのは、AI クローラー自身の UA で取りに行ったとき、同じ応答が返るかどうか。表記の一致・不一致の先にある「実際に入れるか」は、そこで初めて測れます。
参考資料
- Google Search Central「How Google Interprets the robots.txt Specification」(2026年9月17日確認)
- Google Search Central「Tell Google about localized versions of your page」(2026年9月21日更新、9月28日確認)
- MenuMenu「本国の「AI除外」設定は日本向けドメインに届くか|Search Console・Cloudflare・robots.txtの効く単位」
- MenuMenu「その「llms.txt 200 OK」、中身はHTMLです|日本の飲食・宿泊・小売30サイト実測」
- MenuMenu 実測データ:日本進出の韓国・米国ブランド30組、本国サイトと日本向けサイトの robots.txt・hreflang・JSON-LD(2026年9月28日計測)

株式会社MenuMenu 代表取締役
ソフトウェアエンジニアであり、UI・UXデザイナー。2012年からシリコンバレーと韓国でプロダクトをつくってきました。SEO・MEO・AEOの専門家として、訪日観光客と日本のローカルビジネスをつなぐMenuMenuを自ら設計・開発しています。
プロフィールを見る →Next
「見つかっているか」を、数字で確かめませんか。
AIの答え、検索、地図。どこで見つかっていて、どこで見つかっていないのか。まずはサイトを点検し、現状を数字にしてから次の一手を決められます。