AIとチャットしていて、こんな経験はありませんか。「さっき伝えたはずなのに、急にAIが前提となる話を忘れてしまった」。あるいは、Claudeなどのサービスを使っていて「思ったより早く利用制限に到達してしまった」と驚いたことは?
実はこの2つ、原因はどちらも同じ。「トークン」という、AIの世界のちょっとした単位が関係しています。
言葉だけ聞くと難しそうですが、中身はとてもシンプルです。ここを押さえておくと、AIを「早く・賢く・安く」使えるようになります。今日はトークンと、その上手なやりくり方法である「トークンマネジメント」を、初めての方向けにやさしく解説します。
実はこの2つ、原因はどちらも同じ。「トークン」という、AIの世界のちょっとした単位が関係しています。
言葉だけ聞くと難しそうですが、中身はとてもシンプルです。ここを押さえておくと、AIを「早く・賢く・安く」使えるようになります。今日はトークンと、その上手なやりくり方法である「トークンマネジメント」を、初めての方向けにやさしく解説します。
トークンって何?AIが文字を読むときの「最小のかたまり」
一言で表せば、トークンとはAIが文章を処理するときの最小の単位です。
私たちは文章を「単語」や「文字」で数えますが、AIはそれを少し違う切り方で見ています。単語よりも細かく、文字よりは大きい「文字のかたまり」。これがトークンです。たとえば英単語なら、短い単語は1つでそのまま1トークン、長い単語は途中で区切られて2〜3トークンに分かれる、といった具合です。
日本語の場合はもっとシンプルで、おおむね1文字が1トークン前後になると考えておくと感覚がつかめます。厳密には使うAIによっても、ひらがな・漢字・記号でも変わりますが、「だいたい文字数くらい」とざっくり捉えておけば十分です。
つまり、あなたがAIに送る質問も、AIが返してくる答えも、AIの内部ではすべてこの「トークン」という粒に分解して扱われている、というわけです。
私たちは文章を「単語」や「文字」で数えますが、AIはそれを少し違う切り方で見ています。単語よりも細かく、文字よりは大きい「文字のかたまり」。これがトークンです。たとえば英単語なら、短い単語は1つでそのまま1トークン、長い単語は途中で区切られて2〜3トークンに分かれる、といった具合です。
日本語の場合はもっとシンプルで、おおむね1文字が1トークン前後になると考えておくと感覚がつかめます。厳密には使うAIによっても、ひらがな・漢字・記号でも変わりますが、「だいたい文字数くらい」とざっくり捉えておけば十分です。
つまり、あなたがAIに送る質問も、AIが返してくる答えも、AIの内部ではすべてこの「トークン」という粒に分解して扱われている、というわけです。
なぜ「トークン」で数えるの?
ではなぜAIは、わざわざトークンなんて単位を使うのでしょうか。
理由は、AIが文字そのものを「意味」として理解しているわけではないからです。AIは文章を一度トークンに分解し、それぞれを数字に置き換えてから計算しています。人間が文章を読むのとは、そもそも仕組みが違うのですね。
そして私たち利用者にとって大事なのは、このトークンの「数」が2つの大事なことを左右するという点。ひとつは「お金」=「費用」、もうひとつは「記憶」です。順に見ていきましょう。
理由は、AIが文字そのものを「意味」として理解しているわけではないからです。AIは文章を一度トークンに分解し、それぞれを数字に置き換えてから計算しています。人間が文章を読むのとは、そもそも仕組みが違うのですね。
そして私たち利用者にとって大事なのは、このトークンの「数」が2つの大事なことを左右するという点。ひとつは「お金」=「費用」、もうひとつは「記憶」です。順に見ていきましょう。
理由その1:お金——料金はトークンで決まる
まずはおサイフに直結する重要なポイント。
AIをAPIなどで使うときや、従量課金制のサービスでは、使ったトークンの量に応じて料金が決まります。サブスク型のサービスでも、やり取りする トークンの量に応じて、利用制限(リミット)が設定されている場合がほとんどです。
料金は、あなたが送った文章(入力トークン)と、AIが返した文章(出力トークン)の両方でカウントするのが一般的です。
つまり、長い前置きをだらだら書いたり、必要のない資料を丸ごと貼りつけたりすると、その分だけトークンが増え、料金も上がっていきます。また、送った文章(入力)より返答(出力)側を割高に設定しているモデルは多く、AIに長々と答えさせるのも意外とコストに効いてきます。「思ったより高い」の正体は、たいていこの入力と出力のトークンの積み重ねなのです。
もちろん、月額定額でトークンを使い放題のサービスもあります。ただ「使った分だけ支払う」タイプを使うなら、トークンはそのまま通貨のようなもの、と考えておいた方が無難です。
AIをAPIなどで使うときや、従量課金制のサービスでは、使ったトークンの量に応じて料金が決まります。サブスク型のサービスでも、やり取りする トークンの量に応じて、利用制限(リミット)が設定されている場合がほとんどです。
料金は、あなたが送った文章(入力トークン)と、AIが返した文章(出力トークン)の両方でカウントするのが一般的です。
つまり、長い前置きをだらだら書いたり、必要のない資料を丸ごと貼りつけたりすると、その分だけトークンが増え、料金も上がっていきます。また、送った文章(入力)より返答(出力)側を割高に設定しているモデルは多く、AIに長々と答えさせるのも意外とコストに効いてきます。「思ったより高い」の正体は、たいていこの入力と出力のトークンの積み重ねなのです。
もちろん、月額定額でトークンを使い放題のサービスもあります。ただ「使った分だけ支払う」タイプを使うなら、トークンはそのまま通貨のようなもの、と考えておいた方が無難です。
理由その2:記憶——コンテキストウィンドウという「AIの机の広さ」
もうひとつが「記憶」の話。冒頭の「急に前の話を忘れる」現象は、ここに理由があります。
AIには、一度に扱えるトークンの上限があります。これを「コンテキストウィンドウ」と呼びます。難しく聞こえますが、「AIが作業に使える机の広さ」だと思ってください。
机の上には、あなたの質問、これまでの会話、参考資料、そしてAIの答え……そのすべてが「トークン」という書類として広げられています。その机が広いモデルもあれば、狭いモデルもあり、近ごろは非常に広い机を持つモデルも増えてきました。
問題は、どの机にも限りがあるということ。会話が長く続いて書類が机からあふれると、古い情報からAIには見えなくなっていきます。「さっき言ったのに忘れた」のは、その内容がもう机の上に残っていなかったから。AIの意地悪ではなく、机の広さの問題だったわけです。
AIには、一度に扱えるトークンの上限があります。これを「コンテキストウィンドウ」と呼びます。難しく聞こえますが、「AIが作業に使える机の広さ」だと思ってください。
机の上には、あなたの質問、これまでの会話、参考資料、そしてAIの答え……そのすべてが「トークン」という書類として広げられています。その机が広いモデルもあれば、狭いモデルもあり、近ごろは非常に広い机を持つモデルも増えてきました。
問題は、どの机にも限りがあるということ。会話が長く続いて書類が机からあふれると、古い情報からAIには見えなくなっていきます。「さっき言ったのに忘れた」のは、その内容がもう机の上に残っていなかったから。AIの意地悪ではなく、机の広さの問題だったわけです。

土江錠
ガジェットのほか、各種AIや先端技術を追いかけるテックウォッチャー。
ゲームと食べ歩きも少し詳しい。











