AI時代に統計学を学ぶ意味は?社会人が学ぶべき5つの範囲

散布図から相関線が浮かび上がるイラストとともに、社会人が学ぶべき統計知識の範囲を示すアイキャッチ画像 リスキリング

BIツールの画面に「相関係数 0.72」と出ている。

上司に「これ、どういう意味?」と聞かれて、何も言えなかった。

そんな経験はないでしょうか。

数字が出ていること自体は分かります。ただ、それが「強い関係がある」という話なのか、「だから広告費を増やすべき」という話なのか、そこが結びつかない。

AI分析ツールが出す「精度92%」も同じです。高そうな数字に見えます。でも、そのまま信じて資料に載せていいのか、判断できない。

統計を学び直したほうがいいのかもしれない。そう思って調べると、記述統計、推測統計、確率分布、ベイズ……と範囲が広すぎて、最初の一歩が決まらない。

この記事では、「そもそも学ぶ価値があるのか」と「どこまで学べば足りるのか」を一緒に整理します。先に結論だけ言っておくと、必要なのは平均・ばらつき・相関・回帰・p値の5つの考え方です。計算式を覚える話ではありません。

その数字、説明できずに黙ってしまった経験はありませんか

たとえば、こんな場面です。

ダッシュボードに「メール配信数と売上の相関係数 0.72」と表示されている。会議で「じゃあメールをもっと打てば売上が伸びるってこと?」と聞かれる。なんとなく違う気がするけれど、どう違うのかを言葉にできない。

あるいは、AIが作った予測モデルの説明資料に「精度92%」とある。8%外れるという意味なのか、それとも別の何かなのか。聞き返すのも気が引けて、そのまま資料に転記する。

ABテストの結果で「B案のほうが1.2ポイント高い」と出る。これが本当に効果なのか、たまたまなのか。誰も明確に答えないまま、B案の採用が決まる。

どれも、数字が読めないというより「その数字から何を言っていいのか分からない」状態です。ここで止まる人はかなり多いです。

言葉の意味が分からないのは、理解力の問題ではありません

数字が苦手だから、と自分を責めている人がいます。でも、この場面でつまずくのは能力の問題ではないと思います。

理由はシンプルで、学校で習った統計と、仕事で出てくる統計が別物だからです。

学生時代にやったのは、平均を計算する、分散を求める、といった手を動かす作業でした。答えは一つに決まります。一方、仕事で求められるのは「この0.72という数字を見て、次に何をすべきか」という判断です。答えは一つではありません。

つまずくのは「計算」ではなく「意味を判断する」部分

そして、計算はもうツールがやってくれます。

Excelでも相関係数は関数一つで出ます。BIツールなら勝手に表示されます。AIツールに至っては、聞かなくても分析結果を出してくれる。ツール側をどこまで学ぶかで迷っているなら、ExcelからBIツールやSQLへ進むリスキリングの判断基準を整理した記事も参考になります。

つまり、私たちに残されているのは計算のあとの部分だけです。この数字はどこまで信用できるのか。何を言えて、何を言えないのか。

ここを扱うのが統計の「考え方」の部分で、幸いなことに、この部分は数式をほとんど使わずに理解できます。学ぶ範囲を絞れる理由もそこにあります。

学ぶ価値があるかどうかは、3つの視点で見えてくる

あなたが仕事で目にする数字を思い浮かべてみてください。おそらく、悩むポイントは次の3つのどれかに収まります。

一つ目は、「AとBに関係がある」と言われたときに、それをそのまま信じていいのか。

二つ目は、平均値だけを見て判断していいのか。

三つ目は、目の前の差が本物の差なのか、それとも偶然のブレなのか。

この3つに答えられるようになれば、日常の業務で困る場面はかなり減ります。逆に言えば、統計学の教科書に載っている残りの内容は、必要になったときに調べれば間に合います。

以下、順番に見ていきます。

AIが出す「関連性」は、そのまま信じていいのか

相関係数が高い=原因とは限らない

相関係数というのは、要するに「片方が増えたとき、もう片方も一緒に増えるか」を1つの数字にしたものです。

-1から1の間の値をとって、1に近いほど「一緒に増える傾向が強い」。0に近いと「特に関係が見えない」。マイナスなら「片方が増えると、もう片方は減る」。

冒頭の0.72なら、そこそこはっきり一緒に動いている、という程度の意味です。

問題はここからです。一緒に動いていることと、片方がもう片方の原因であることは、別の話です。

たとえば、メール配信数と売上に相関が出たとします。でも実際には、セール期間中にメールを増やしていて、売上もセールで伸びていた、というだけかもしれません。この場合、原因はセールであって、メールではない。メールだけ増やしても売上は動きません。

会議で「相関があるので効果があります」と言われたら、心の中で一つ質問を用意しておくといいです。「他に、両方を同時に押し上げている要因はないですか」。

これが言えるだけで、数字との付き合い方は変わります。

回帰は「関係から未来を見積もる」計算にすぎない

回帰分析という言葉も、レポートによく出てきます。

やっていることは、過去のデータから「この条件ならこれくらいになりそう」という見積もりの式を作ることです。広告費をこれだけ使ったら、売上はこれくらい、といった具合に。

AIの予測モデルも、根っこの発想はこれに近いです。過去のパターンから、この先を見積もっている。

ここで押さえておきたいのは、回帰はあくまで過去のデータの範囲で成り立つ、ということです。過去に月100万円までしか広告を使ったことがないなら、「1000万円使ったらどうなるか」の予測は、根拠のない外挿になります。

「精度92%」のような数字も同じ枠組みで見てください。過去のデータで試したら92%当たった、という意味であって、これから先も必ず92%当たるという保証ではありません。市場やユーザーの行動が変われば、精度は落ちます。

数字を疑えという話ではなく、「どのデータで測った数字か」を一度確認する、という習慣の話です。

平均だけ見て判断すると、足をすくわれることがある

標準偏差は「平均からのズレ方」を表す数字

レポートに出てくる数字の多くは平均です。平均単価、平均滞在時間、平均問い合わせ件数。

ただ、平均は真ん中を教えてくれるだけで、中身の散らばり具合は教えてくれません。

そこを補うのが標準偏差です。ざっくり言えば「みんな平均の近くに集まっているのか、それとも上下にバラけているのか」を表す数字です。小さければ全員が似たような値。大きければ、平均から大きく離れた人が多い。

Excelなら関数一つで出ます。計算の中身を覚える必要はありません。「平均とセットで、ばらつきも見る」という発想さえあれば十分です。

同じ平均でもバラつきが違えば打ち手も変わる

具体的に考えてみます。

A店とB店、どちらも顧客の平均購入額が5,000円だとします。

A店は、ほとんどの客が4,500〜5,500円あたりに集まっている。B店は、1,000円の客と20,000円の客が混ざった結果、平均が5,000円になっている。

同じ「平均5,000円」でも、やるべきことは全然違いますよね。A店なら全体の単価を底上げする施策が効きそうです。B店なら、まず高額購入層を分けて考えたほうがいい。全員向けの施策は、どちらの層にも刺さらない可能性があります。

平均だけ見ていると、この違いが見えません。

日経クロストレンドのようなビジネスメディアが、標準偏差をビジネスパーソンの必修ワードとして扱っているのも、こういう場面が実務で頻繁に起きるからだと思います。

その差は「意味のある差」か「たまたまのブレ」か

p値は「偶然でも起こりうる確率」を表す数字

ABテストで、A案のクリック率が3.0%、B案が3.2%だった。B案の勝ち、と言っていいでしょうか。

サンプルが10人ずつなら、たぶん言えません。1万人ずつなら、言えるかもしれない。この「言えるかどうか」を判断するための道具が、p値です。

p値は「もし本当は差がなかったとして、それでもこれくらいの差が偶然に出てしまう確率」を表します。

この値が小さいほど、「偶然でこの差が出るとは考えにくい」ということになります。慣習的に0.05(5%)を境目にすることが多く、それより小さければ「意味のある差とみなそう」と判断されます。

ただし、0.05はあくまで慣習的な線引きです。物理法則ではありません。0.049なら勝ちで0.051なら負け、というほど厳密なものではない、という感覚を持っておくと誤読が減ります。

仮説検定という考え方が使われる場面

この「偶然かどうかを確かめる」手続き全体を、仮説検定と呼びます。

名前は硬いですが、やっていることは日常の判断と似ています。「差があるように見えるけど、本当にそう言い切っていいのか、一度疑ってみる」。それだけです。

実務で出てくるのは、たとえばこんな場面です。

  • LPのA/Bテストで、どちらが本当に良かったのか
  • 施策の前後で問い合わせが増えたが、季節要因ではないか
  • アンケートで男女差が出たが、回答者数が少なすぎないか

AI分析ツールが「有意な差が見られました」と出してくることもあります。そのとき「何と比べて、どれくらいのデータで判断した結果なのか」を確認できれば、数字に振り回されずに済みます。

ここまでで3つの視点が揃いました。関係があるように見えるだけか。平均の裏に何が隠れているか。その差は本物か。この3つです。

学ぶ範囲の目安は、公的な講座や検定にも表れている

「本当にこれだけでいいのか」と思うかもしれません。その感覚は自然だと思います。

そこで、外部の目安を一つ挙げておきます。

総務省の無料講座がカバーする範囲は、ここまでの内容とほぼ一致する

総務省統計局が、社会人向けのオンライン統計講座を無料で提供しています。入門編、演習編、統計オープンデータの3つがあり、いずれも受講料はかかりません。

このうち「社会人のためのデータサイエンス演習」は5週構成で、中身の並びが興味深いです。

第2週がデータの特徴と2つの変数の関連性、つまり記述統計と相関。第3週が複数の変数から1つを予測する方法で、これが回帰にあたります。第4週が、データ間の差が偶然か意味のある差かを判定する方法、つまり仮説検定です。

この記事で挙げた5つと、ほぼ重なっています。

演習はExcelを使って進む部分があり、統計ソフトの知識がなくても取り組める設計です(一部にRを使う演習も含まれます)。この講座は2016年4月に開講し、2023年度の開講告知の時点で延べ8万7千人が受講したと案内されています。文部科学省の社会人学び直しポータル「マナパス」にも掲載されています。

つまり、「社会人が仕事で使う統計」として公的に整理された範囲も、だいたいこのあたりで区切られている、ということです。

なお、開講スケジュールは年度によって変わります。受講したい場合は公式ページで現在の状況を確認してください。

統計検定は目安になるが、必須の資格ではない

もう一つ、統計検定という試験があります。日本統計学会が関わる全国統一試験で、級による区分のほかに、データサイエンス系の区分(DS基礎・DS発展・DSエキスパート)が設けられています。

学ぶ範囲の地図として眺める分には役立ちます。ただ、マーケティングや企画の仕事で統計の資格を求められる場面は、そう多くないはずです。

資格を取ることが目的化すると、本来必要だった「数字を説明できるようになる」という目的から離れていきます。まずは目安として知っておく程度でいいと思います。

独学で足りるか、講座を使うかは続けられるかで決める

独学で足りるのは「意味を理解したい」だけの場合

この記事で扱った範囲、つまり「相関と因果は違う」「平均だけでは足りない」「差が偶然かを確かめる」といった考え方は、独学で十分に身につきます。

書籍でもいいですし、業務で出てくる数字を一つずつ調べていく形でもいい。計算はExcelやツールがやってくれるので、手を動かす負担も小さいです。

自分で調べて納得できるタイプなら、わざわざお金をかける必要はないと思います。

公的講座を使うと決まったペースで進められる

一方で、独学が止まりやすい人もいます。私も、興味だけで始めた勉強を途中で放置した経験が何度もあります。自分がどちらのタイプか迷うなら、独学とスクールのどちらが向いているかを見極める判断基準を先に確認しておくと決めやすくなります。

そういう場合は、週ごとに区切られたカリキュラムがあるほうが進みます。総務省の講座は無料なので、金銭的なリスクもありません。合わなければやめればいい。

有料のスクールを検討するのは、統計そのものというより「分析業務そのものを仕事にしたい」「PythonやRを使って自分で分析を回したい」といった段階になってからで遅くないと思います。今困っているのが「数字の意味を説明できないこと」なら、まず無料の範囲で足ります。

まずは、次に出てくる数字を1つ疑ってみることから

今日から始められることを一つだけ挙げます。

次の会議で数字が出てきたら、その場で一つだけ質問を用意してみてください。

「これは平均ですか。ばらつきはどれくらいですか」
「相関が出ているとして、他に原因になりそうな要因はありますか」
「その差、サンプル数はどれくらいですか」

どれか一つで構いません。質問できなくても、頭の中で問いを立てるだけでいいです。

その問いに自分で答えられなかったところが、あなたにとっての学習範囲になります。教科書の最初のページから始める必要はありません。実際に困った場所から埋めていくほうが、確実に身につきます。アクセス解析の画面で同じ壁に当たっているなら、GA4の指標を提案につなげる考え方も同じやり方で整理できます。

整理すると、統計を学ぶ意味は、AIツールが出す数字を鵜呑みにせず自分の言葉で説明できるようになることにあります。範囲は平均・ばらつき・相関・回帰・p値の5つで、体系的に網羅する必要はありません。

そして、その5つがだいたい妥当な区切りであることは、総務省の社会人向け講座の構成からも確認できます。無料なので、腰を据えて学びたくなったときの選択肢として覚えておいてください。

コメント

タイトルとURLをコピーしました