データマイニング
果てしなく積み上がった巨大な砂の山をふるいにかけ、キラリと光る本物の砂金をすくい上げる技術です。
定義 データマイニング(Data Mining)とは、コンピューターに蓄積された膨大なデータの中から、人間が気づかなかった有用なルールや隠れたパターン、将来の予測につながるシグナルを見つけ出す技術のことです。鉱山(マイニング)から鉱物を掘り出すように、一見何の役にも立たなそうな巨大な情報の山から、宝石のような価値ある知識を発掘するプロセスのことです。
砂の山から金を掘り出す方法
私たちが毎日受け取るレシート、ネットの検索履歴、スマートフォンの位置情報などは、際限なく積もる土砂のようなものです。土砂そのものは散らかっていて無価値に見えますが、その中には「どんな人が雨の日に何を一緒に買うのか」といった役立つ法則が隠されています。
データマイニングは、まさにこうしたビッグデータの土砂を精密なふるいにかける作業です。スーパーで「紙おむつを買った客はビールも一緒に買う」という有名な話のように、一見関係なさそうな商品同士の購買パターンを見つけ出すことにも使われます。
人間の目では何億行ものデータ帳簿から関連性を見つけ出すのは不可能ですが、コンピューターは統計や分析ルールを駆使して、埋もれている意味のあるパターンを一瞬でキャッチします。
もう少し正確に言うと:隠れたパターンはどうやって見つける?
もう少し専門的に言うと、データマイニングは単なるデータ検索や統計の要約表を作ることとはまったく異なります。すでに分かっている問いへの答えを探すのではなく、何が隠されているのかさえ分からない状態から出発する探索作業なのです。
データマイニングには大きく4つの主要な手法が使われます。1つ目は似た特徴を持つ顧客同士をグループ分けする「クラスタリング」、2つ目は新しいデータがどこに属するかを判定する「分類」、3つ目は「商品Aを買う人は商品Bも一緒に買う」といった関係性を探る「関連分析(アソシエーション分析)」、4つ目は普段とはまったく異なる異常な行動を検知する「外れ値・異常検知」です。
これらの技術を活用することで、金融機関はクレジットカードの不正利用をリアルタイムで検知し、動画配信サービスはユーザーが気に入りそうな動画をズバリおすすめできるようになります。
機械学習(マシンラーニング)とは何が違うの?
データマイニングについて考えるとき、AI(人工知能)や「機械学習(マシンラーニング)」と混同してしまうことがよくあります。この2つは親戚のように重なり合っており、使うツールも共通していますが、目指すゴールが少し異なります。
機械学習は、コンピューターにデータを学習させて「自ら未来を予測したり、人間の代わりに判断したりする賢い頭脳」を作ることが主な目的です。一方でデータマイニングは、大規模なデータの中に埋もれていた人間が理解できる知識や洞察を発掘することに重点を置いています。
つまりデータマイニングは、過去と現在の膨大な記録から新たな事実を発見し、人間がより賢く正しい意思決定を下せるようサポートする羅針盤のような役割を果たしているのです。
🤔 よくある誤解
データマイニングは、検索窓にキーワードを入れて探したい情報を見つけることと同じだ。
検索(クエリ)は既に存在する具体的なデータを探し出す作業ですが、データマイニングはそのデータの間にどんな法則や関係性が隠れているかを探索し、新たな知識を明らかにする作業です。
🧺 日常で出会う場面
データマイニングとは、膨大なデータの山からコンピューターのアルゴリズムを使って、隠れたパターンや法則という宝石を発掘する技術です。