See where CDP is headed with AI — Agentic World 2026, Oct 5–7, Miami →
English
グロッサリー

予測分析とは?仕組みと活用事例、CDPでの実装

予測分析とは、過去のデータに統計モデルや機械学習を適用し、将来何が起こりうるかを確率として示す分析手法である。記述的分析・処方的分析との違い、自社で組む直接活用と製品に組み込まれた間接活用の使い分け、LTVや解約可能性の予測、精度を左右するのがモデルよりデータである理由、導入の進め方までを解説する。

Kazuki Ohta Kazuki Ohta 読了目安 1 分

予測分析とは、過去のデータに統計モデルや機械学習を適用し、将来何が起こりうるかを確率として示す分析手法である。 「何が起きたか」を記述する分析の上に立ち、回帰、決定木、ニューラルネットワークといった手法で過去の傾向を学習させ、まだ起きていない事象の起こりやすさを返す。返ってくるのは断定ではなく確率であり、確実な予言ではない。

業種を問わず使われるが、顧客データを扱う領域では、その顧客が次に何を買うか、いつ離れるか、どれだけの価値をもたらすか、という3つの問いにおおむね集約される。

4つの分析手法の中での位置づけ

分析手法答える問い出力の例
記述的分析何が起きたか先月の解約率、チャネル別の売上
診断的分析なぜ起きたか解約が増えた要因の特定
予測分析何が起こりうるか顧客ごとの解約確率、来月の需要量
処方的分析次に何をすべきかこの顧客に出すべきオファーの提示

4つの関係はデータ分析で整理している。予測分析は記述的分析の延長線上にあり、集計できていないデータからは予測も作れない。反対に、予測を出しても次の行動が決まらないのであれば、処方的分析まで届いていない状態である。

なお日本語では「予測的分析」と表記されることもあるが、指している内容は同じである。本サイトでは記述的分析・診断的分析・処方的分析と並べる場合も含め、「予測分析」に統一する。

直接活用と間接活用

企業が予測分析を使う形は、大きく2通りに分かれる。

直接活用は、データ分析の担当者やデータサイエンティストが自らデータを集め、モデルを構築して運用する形である。PythonやRといった言語、商用の統計解析ツール、クラウド事業者の機械学習サービスを組み合わせて使う。モデルの前提と誤差の性質を把握したうえで運用できる一方、データ基盤を整え、人材を確保する必要がある。

間接活用は、予測機能が組み込まれた製品をそのまま使う形である。MAツールのリードスコア、CDPが算出するLTVや解約可能性の予測属性、レコメンデーションエンジンの推奨結果は、いずれも予測分析の出力である。使う側がアルゴリズムを理解している必要はなく、見えるのは「リードの商談化率が上がった」という結果だけになる。

自社固有の定義を必要としない予測ほど、間接活用で足りることが多い。

精度を決めるのはモデルよりデータ

実務でつまずくのは、アルゴリズムの選択ではなく入力データであることが多い。同じ顧客がWeb、アプリ、店舗、コールセンターで別々のIDとして記録されていれば、モデルは一人の顧客の行動を複数人の断片として学習することになる。購買間隔や接触頻度といった特徴量は、そもそも成立しない。

名寄せによって識別子を束ね、シングルカスタマービュー(SCV)として一人分の履歴が揃ってはじめて、これらの特徴量が意味を持つ。CDP(カスタマーデータプラットフォーム)が予測分析の土台として挙げられるのは、この工程を標準機能として備えているためである。

ファーストパーティデータを軸に組み立てることには、精度以外の理由もある。サードパーティCookieの利用が制限されるなかで、自社が同意を得て収集したデータは、モデルの入力として使い続けられる見通しが立つ。

マーケティングでの代表的な使われ方

  • LTVの予測:初期の購買行動から顧客生涯価値(LTV)を推定し、獲得コストの上限や対応の優先度を決める。
  • 解約の予測:利用頻度の低下や問い合わせの増加といった兆候から解約可能性を算出し、解約が起きる前に手を打つ。
  • 購買傾向のスコア化:特定の商品を買う確率を顧客ごとに出すプロペンシティモデリングは、オファーの出し分けの基準になる。
  • リードの優先順位づけ:商談化しやすい見込み客を上位に並べるAIによるリードスコアリングで、営業の接触順を決める。
  • 需要の予測:来店数や販売数の見込みから、在庫と人員の配置を決める。

これらの出力は、オーディエンスセグメンテーションの条件として使うと効き方が変わる。「過去に3回買った顧客」ではなく「今後90日以内に解約する確率が上位10%の顧客」で対象を切り出せるようになるためである。マーケティング領域での適用範囲はマーケティングにおける予測分析で個別に扱っている。

予測を施策につなぐまでが工程

予測スコアは、算出しただけでは何も変わらない。スコアがメールの配信対象、サイト上の表示、応対画面の推奨内容に反映されてはじめて、顧客が受け取るものが変わる。この工程がデータアクティベーションである。

  • 対象の抽出:予測スコアをセグメントの条件として使う。
  • 判断:どのオファーを、どのチャネルで、どの時点で出すかを決める(AI意思決定、ネクストベストアクション(NBA))。
  • 結果の回収:実行した施策の結果をデータ基盤へ戻し、次の学習の入力にする。

結果が戻らない構成では、モデルの精度は初期の学習データの水準に固定される。cdp.comが Customer Intelligence Loop(顧客データの収集・統合・活用を継続的に回す仕組み)と呼ぶ5段階のサイクルが閉じた輪として設計されているのは、この学習の遅れをなくすためである。

導入の進め方

  1. 予測したい事象を1つ決める:解約、次回購入、需要量など。同時に、その予測が出たときに実際に取る行動も先に決めておく。行動が決まらない予測は運用に乗らない。
  2. 必要なデータを揃える:購買履歴、行動ログ、属性、対応履歴。予測したい事象が過去のデータの中で観測できていることが条件になる。
  3. 前処理する:欠損値と重複の処理、表記の統一(データクレンジング)。必須項目の欠損は、そのまま精度に跳ね返る。
  4. モデルを構築し、検証する:学習に使っていない期間のデータで精度を確認する。
  5. 出力を配信する:スコアをCDPやMAツールのプロファイル属性として書き戻し、施策の条件として使える状態にする。

実務で外しやすい点

  • 過去に例のない事象は予測できない:予測分析が返すのは過去の傾向の延長である。制度の変更や新規参入のように過去のデータにない変化は、モデルの外側にある。
  • 精度の追求が目的化しやすい:精度が数ポイント上がっても、それによって打ち手が変わらないのであれば成果は動かない。どの水準を超えたら判断が変わるのかを先に決める。
  • 利用目的の範囲:個人情報保護法では、取得時に通知・公表した利用目的の範囲を超えた取り扱いは原則として認められない。購買履歴から解約可能性を算出して施策に使うことがその範囲に含まれるかは、同意管理の記録とあわせて確認する。
  • 説明できるかどうか:金融や医療のように判断の根拠を示す必要がある領域では、精度の高い複雑なモデルより、説明できるモデルが選ばれる場合がある。

予測モデルの構築と精度の維持

予測モデルは、データサイエンスのチームが手作業で組み上げる場合も、プラットフォームが内部で組み立てる場合も、基本的には同じ工程をたどる。出発点は、できるだけ狭く定めた問いである(次の四半期に解約するのはどの顧客か、どのリードが商談に至るか)。モデルは、明示的に学習させた事象の起こり方しか学べないためである。次に過去のデータを二つに分ける。アルゴリズムが学習に使う訓練データと、モデルが一度も見ていない検証用データである。検証用データでの成績が、学習に使わなかったデータに対してモデルがどの程度当たるのかを示す。

検証用データを用意するのは、過学習を見つけるためである。モデルは訓練データの癖を暗記して、そのデータの上では高い精度を出しながら、新しいデータでは外すことがある。ここで効くのは検証の手順を守ることであって、モデルを複雑にすることではない。運用が始まると、仕事の性質は変わる。予測が実際の意思決定に使われるようになり、その裏で顧客の行動は季節、価格改定、新しいチャネルの登場によって動き続けるからである。再学習しないモデルは、明確な壊れ方として現れない。スコアが現実から徐々にずれていき、それを基に組んだ施策の成果が落ちた時点で初めて、ずれに気づくことになる。リリース後に予測を有用に保つのは、計画的な再学習と、続ける精度の点検である。

予測モデルの主な種類

どの種類のモデルを選ぶかは、具体的なアルゴリズムの選択よりも重要である。種類ごとに答える問いが違うからである。予測分析の仕事の大部分は、次の4種類に収まる。

モデルの種類出力答える問い起こりやすい失敗
分類「買う」「解約する」のようなカテゴリーこの顧客はどのグループに入るか起こりにくい側の事象の過去例が少なすぎて、モデルが起こりやすい側ばかりを予測する
回帰来四半期の支出額のような数値どのくらいか、いくつか過去データの範囲を超えて外挿し、その範囲では関係がもはや成り立たない
時系列予測来月の需要のような時間軸に沿った将来値この指標は時間とともにどう動くか季節的な急増を恒常的な傾向と読み、在庫や人員をそれに合わせて用意してしまう
アップリフトモデリングある施策が結果をどれだけ変えるか施策が逆効果になるため、手を付けないほうがよい顧客は誰か通常の過去履歴で学習してしまい、因果ではなくノイズを拾う

見込み客を優先度順に並べた一覧が欲しいチームには分類が、在庫計画を立てるチームには時系列予測が合う。4種類のうち、施策を実際に試した結果を学習データとして要求する点で他と異なるのはアップリフトモデリングである。種類の選択に迷うときは、出力された結果を誰がどの判断に使うのかから逆に決めると、問いの側が先に固まる。問いとモデルの種類の対応を誤ることは、技術的には正しい予測が役に立たなくなるよくある原因である。誰も問っていない問いに、モデルが答えているからである。

運用で予測モデルが機能しなくなるパターン

予測分析の失敗のほとんどは、特殊な原因によるものではない。限られたパターンに収まり、それぞれに定番の対処がある。

失敗のパターン見える症状対処
データドリフトリリース時の精度は問題なかったのに、顧客行動の変化とともに成果が静かに悪化する新しい結果に対する精度を計画的に測り直し、落ちてきたら再学習する
入力の破綻上流の項目の改名や計測タグの故障のあと、スコアが一律になる、または空になる出力だけでなく、モデルへの入力の品質を検証する
フィードバックループモデルがあるセグメントへの施策を打たずにいると、そのセグメントが本来どうだったかを学習する機会が消える一部の顧客を施策の対象から外して残し、モデルが実態を学習し続けられるようにする
精度の過信高いスコアを保証のように扱い、一つのセグメントに投資を集中させるスコアとともに不確実性を報告し、判断の規模をその不確実性に合わせる

共通するのは静けさである。予測モデルはめったに明確には壊れず、徐々に当たらなくなっていく。損害は、別の誰かの報告の形で表面化する。伸びない施策、規模を誤った発注である。モデルを一度きりのプロジェクトではなく、監視と手入れを続ける対象として扱うかどうかが、価値を積み重ねられる予測分析と、静かに劣化していく予測分析を分ける。

予測分析とエージェンティックAI

予測は、それ単独では何も変えない。予測を受けて動くものが別に必要であり、ここがエージェンティックAIとの分岐点である。モデルは何が起こりそうかを推定し、エージェントが応答を決めて実行する。入札額の調整、メッセージの下書き、引き止めオファーの発動である。エージェンティックCDPでは、この受け渡しが顧客データを統合したのと同じプラットフォームの内部で完結する。予測と実行が一つのループの中に留まる。

実行の質は、その土台にある予測の質を超えられない。古くなった、あるいはずれ始めたスコアで動くエージェントは、誤った行動を機械ならではの速さで、顧客全体の規模で取ってしまう。間に入って止められる人間も少ない。前節までに述べた監視と手入れは、ここでさらに重要になる。分かりやすいのがエージェンティックパーソナライズである。個人の好みの予測が、確認する人間を介さずに、顧客に見せるコンテンツを選ぶ。実行が自律化するほど、モデルの監視はデータサイエンスチームの心遣いではなく、運用全体を制御する仕組みになっていく。

FAQ

予測分析とデータ分析は何が違うのか?

データ分析は過去に何が起きたかを把握する工程を含む広い概念であり、予測分析はそのうち将来何が起こりうるかを扱う領域である。 予測分析は記述的分析の出力を入力として使うため、集計と可視化ができていない状態でモデルだけを作っても、学習に使えるデータが揃わない。

「予測的分析」と「予測分析」は違うものか?

同じものを指す表記のゆれである。 英語の predictive analytics の訳語として両方が使われている。記述的分析・診断的分析・処方的分析と並べるときに「的」を揃えて「予測的分析」と書かれることが多いが、内容の違いはない。

予測分析にはどのようなツールが必要か?

自社でモデルを構築するならPythonやR、クラウド事業者の機械学習サービス、商用の統計解析ツールが選択肢になる。 一方、LTVや解約可能性のような定番の予測であれば、CDPやMAツールに標準機能として組み込まれているものを使う方が早い。判断の基準は、予測したい事象が汎用的なものか、自社固有の定義を必要とするかである。

CDPがなくても予測分析はできるのか?

できる。ただし顧客単位の予測に限っては、名寄せをどこかで行う必要がある。 データウェアハウス上で名寄せと特徴量の作成を自前で組む構成でも成立する。CDPを使う場合との違いは、その工程を作り込むか、標準機能として使うかにある。判断の観点はAI時代のCDPの評価基準で扱っている。

どの予測から始めるのが現実的か?

打ち手がすでに決まっている事象から始める。 解約可能性であれば引き止めの施策、購買傾向であればオファーの出し分けである。最初の1件の成否を分けるのは、予測の精度よりも、予測を受け取る施策が動いているかどうかである。

予測分析のモデルの精度はどのくらいか?

何を予測するか、背景にあるパターンがどれだけ安定しているか、学習データがどれだけ新しいかで変わる。判断の基準は、誤りが小さく、かつ安定していて、施策に乗せられる水準にあるかどうかである。 繰り返し購入やサブスクリプションの更新のように過去に明確なパターンがある事象は、まれな一度きりの事象よりも当てやすい。精度は、モデルが一度も見ていないデータで測り、リリース後も測り直す。顧客行動やデータパイプラインの変化とともに成績が落ちていくためである。

予測分析にはデータサイエンティストが必要か?

多くの場合、必要ない。組み込み型のツールやプラットフォームが、モデルを書かない業務担当者の手元に予測機能を届けているためである。ただし独自の予測には、依然としてデータサイエンスの専門知識が要る。 これは本ページの直接活用と間接活用の違いと同じ構図である。間接活用の利用者は、モデルに触れずに、リードスコアの改善や解約のアラートを受け取る。データサイエンティストが力を発揮するのは、問いが自社固有であるとき、複数のデータソースにまたがるデータをつなぐ必要があるとき、精度を検証し、リリース後も監視し続けなければならないときである。

関連用語

この記事は他の言語でも読めます: Predictive Analytics · O que é análise preditiva? Modelos e usos · Analyse prédictive : définition et cas d'usage · Predictive Analytics: Definition und Einsatz

Kazuki Ohta
執筆者

Kazuki Ohta is Co-Founder & CEO of Treasure AI (formerly Treasure Data), which he co-founded in 2011. A co-developer of Fluentd, a CNCF graduated open-source project, he previously served as CTO of Preferred Infrastructure. Ohta graduated with honors in Computer Science from the University of Tokyo and conducted research in high-performance computing and large-scale data processing as a visiting researcher at Argonne National Laboratory. CDP.com is managed by Treasure AI as an educational resource.