「とにかくデータを集めておこう」。
分析の現場でこの一言が出た時点で、たいてい何かがずれ始めている。
集めること自体が目的になり、何を明らかにしたいのかが後ろへ消える。
データ分析の技術は、手法の一覧として語られがちだ。
サンプリング、可視化、前処理、統計。
だが、それらを全部知っていても、さっきの「とにかく集める」は防げない。
効くのはもっと地味な一つの問いで、しかもAIが分析を速くするほど、その問いの値打ちは上がっていく。
仮説と観察のループを回す
一方通行ではなくループで考える
まず、分析の基本の形から見直す。
「仮説を立てて検証する」と一方通行で教わることが多い。
だが、実態はもっと行ったり来たりしている。
仮説がなければ、そもそもデータの取り方が決まらない。
かといって、データの素性を知らなければ、筋のいい仮説も立てられない。
だから、粗い仮説でデータをざっと眺め、仮説を直し、焦点を絞った観察へ進む。
このループを回すのが、現場の実態に近い。
仮説は、「何を見るか」「何を比較するか」の軸をくれる。
ただし、仮説に固執すれば確証バイアスに落ちる。
逆に、仮説がないと動けないと思い込む必要もない。
手がかりがないときは、探索的データ分析(EDA)から入ればいい。
EDAは大規模データでも機能する
EDAというと、全データを目で眺める素朴な作業に聞こえる。
だが実際は、データの地図を効率よく描く技術だ。
規模が大きくなっても、段階的に焦点を絞れば機能する。
- データの素性を知る段階:各カラムの型、欠損率、ユニーク数、基本統計量で、分析対象を絞る
- 変数間の関係をざっくり掴む段階:相関行列やクラメールのVで俯瞰し、強い関連のあるペアだけ深掘りする
- サンプリングして深掘りする段階:統計的に妥当なサンプルを抽出して、丁寧に分析する
サンプリングには作法がある
その三段目のサンプリングにも、作法がある。
先頭N行を取るのは、サンプリングではない。
時系列データなら特定時期だけ、ログなら初期ユーザーだけ、という偏りを平気で拾ってしまう。
- ランダムサンプリング:全体傾向を掴むための基本
- 層別サンプリング:希少なカテゴリを見たいとき、グループごとに抽出数を制御する
そして層別サンプリングには、「何で層を分けるか」の判断が要る。
つまり、ここにもまた仮説が顔を出す。
目的なき分析が失敗する構造
すべての手段は目的から逆算される
ここまでの手法選びを、一段引いて眺めてみる。
データの取得粒度、サンプリング手法、可視化、前処理。
分析のあらゆる意思決定は、「今、何を明らかにしたいか」から逆算して決まっている。
だから、目的を持たずに手段を選ぼうとすると、行き先を失う。
その典型が、冒頭の「とにかくデータを集める」だ。
明らかにしたいことが定まらないまま、手段だけが増えていく。
「とにかくデータを集める」が起きる理由
ただ、この失敗を「意識が低いから」で片づけると、また同じことが起きる。
「とにかく集める」には、構造的な理由がある。
- 後から取れないデータがあるという恐怖(センサーデータ、ログなど)
- 仮説を立てられる人がいない(ドメイン知識とデータリテラシーの両方を持つ人材の不在)
- 「データ活用やってます」というポーズが目的化している
一つめは、設計で対処できる。
生データは高頻度で保存しておき、分析用には目的に応じた粒度へ集約すればいい。
二つめと三つめは、組織の問題だ。
ツールを入れても、ここは解けない。
AI時代にこそ価値が上がるもの
違和感を持つ力が仮説を生む
では、AIが分析を肩代わりする時代に、人間側に残るものは何か。
起点になるのは、たぶん「違和感」だ。
データの違和感に気づくには、三つが要る。
- ドメイン知識と相場観:「正常な状態」を知らなければ、「おかしい」とは感じられない
- 批判的思考:きれいな結論が出たときこそ、「できすぎていないか」と疑う習慣
- 素朴な疑問を口に出す勇気:「このデータはどう取得されたのか」という基本の問いが、致命的な欠陥を暴くことは多い
「この数値、高すぎないか」という違和感は、「本来はもっと低いはずだ」という暗黙の仮説そのものだ。
違和感は仮説の種であり、仮説を立てる力と違和感を持つ力は、同じ思考の裏表になっている。
速さに流されないこと
AIによって、分析の実行速度は劇的に上がった。
だが、速く回せることと、正しく回せることは、別の話だ。
「とにかくAIに分析させる」は、「とにかくデータを集める」と同じ構造の失敗を起こしうる。
AIはループの実行を加速する。
だが、起点になる違和感までは自動化できない。
AIに問いを立てさせることはできても、その問いに追う値打ちがあるかを見極めるのは、人間の側だ。
自分が判断できる領域では、AIの加速がそのまま効く。
判断できない領域では、加速がリスクの加速に変わる。
だから、冒頭の「地味な一つの問い」に戻る。
それは、「自分は今、何のためにこれをやっているのか」だ。
AIの出力を採用した時点で、それはもう自分の判断になる。
最初にやるべきは、AIを使いこなすことではなく、自分が何を判断できて何を判断できないかを、正直に把握することだ。
