非構造化データ

仕切りのある引き出しに整理された靴下ではなく、大きなリュックの中に自由に入っているさまざまな持ち物のようなものです。

定義 きれいに仕切られた棚のように決まった形式で保存されているのではなく、日常の会話や写真、動画のように決まった形を持たない自由な形式のデータを指します。

エクセル表と日記帳の違い

整理整頓されたタンスの引き出しを思い浮かべてみてください。靴下の段には靴下だけ、下着の段には下着だけが入っていると、必要なものを探すのがとても簡単ですよね。コンピューターの世界でこのような引き出しの役割を果たすのが「構造化データ」です。名前、年齢、電話番号のように、決められたマス目(行と列)にすっきりと収まる情報のことです。

しかし、私たちが日々生み出している情報の多くは、引き出しの中にきれいに収めるのが難しいものです。友達とメッセージアプリで交わした日常会話、週末に撮った料理の写真、動画サイトに投稿した動画、街中で録音した音声メモなどは、決まった規格の枠で区切ることができません。このように決まった形式や枠組みを持たないデータを「非構造化データ」と呼びます。

驚くべきことに、今日人類が生み出しているデジタルデータの80%以上が、この非構造化データだと言われています。私たちがスマートフォンで日常を記録し、インターネットでコミュニケーションを取るすべての行動が、広大な非構造化データの海を作り出しているのです。

構造化データと非構造化データの比較 構造化データ 定型フォーマット 非構造化データ(80%以上) 非定型の自由な形式

厄介者から宝物へと変身した理由

かつてのコンピュータープログラムは、数値を計算したり決められた表を検索したりすることは得意でしたが、写真や文章の意味を自ら理解することはできませんでした。写真ファイルは、コンピューターの目には単に正体不明な無数の色の点の並びにしか見えなかったのです。そのため、非構造化データは保存容量を圧迫するだけの扱いにくい厄介者と見なされることもありました。

しかし、人工知能(AI)やディープラーニング(深層学習)技術が発展したことで、状況は一変しました。AIは何百万枚もの犬の写真を見ることで自ら犬の共通の特徴を学び、無数の文章を読むことで言葉の裏にある意味や感情まで読み取れるようになったのです。

今や企業は、顧客が残した率直なレビュー文章を分析して商品の改善点を見つけ出したり、道路上の映像データを解析して自動運転技術を学習させたりしています。磨かれていない原石のように放置されていた非構造化データが、AIと出会ったことで最も価値のある原材料へと生まれ変わったのです。

もう少し正確に言うと:半構造化データとメタデータ

世の中のすべてのデータが、ナイフで切るように「構造化データ」と「非構造化データ」の2つだけに分かれるわけではありません。その中間に位置する「半構造化データ」というものもあります。ウェブページを形作るHTMLや、データの受け渡しに使われるJSONのように、表形式ではないものの内部にタグ(見出しの目印)が付いていて、大まかな構造を把握できる形式です。

また、非構造化データの中にも隠れた秩序が存在します。スマートフォンで撮った写真そのものは非構造化データですが、写真ファイルの中には撮影日時、場所、カメラの機種といった情報が一定の形式で記録されています。これをデータを説明するデータであるメタデータと呼びます。

最近では、非構造化データの意味をコンピューターが数学的に比較できるよう、数値の集まり(ベクトル)に変換して保存する技術が広く使われています。一見するとバラバラに見える情報でも、そこに込められた意味をAIが理解できるように加工して活用しているのです。

🤔 よくある誤解

✕ 誤解

非構造化データは規則性がないため、構造化データよりも価値が低い。

✓ 事実

過去には分析が困難でしたが、AI技術の進歩により、人の思考や行動パターン、感情が詰まった非構造化データが、企業や研究において最も強力な中核資産になりました。

🧺 日常で出会う場面

1 YouTubeに投稿される動画やコメント、ショート動画などは代表的な非構造化データです。
2 病院で撮影したレントゲン写真や、医師がカルテに自由に記入したメモも非構造化データに該当します。
💡 つまり ひとことで

非構造化データとは、決まった表形式を持たない写真、動画、テキストなどのことで、現代の人工知能(AI)における最も重要な学習材料です。