AIが役立てられるのは「4条件」を満たす文書だけ

RAG(検索拡張生成)型の社内AIが力を発揮できるのは、➀文書として存在する、➁機械が読める形式で保存されている、➂内容が最新で正しい、➃質問した本人に見せてよい情報である ― この4条件を満たす文書だけです。現実の社内データは、高い確率でどれかを欠いています。厄介なのは、どれをどの程度欠いているかは測るまで分からないこと。しかも実態は大抵、思っているより悪いのです。

Point

診断なしの整備は、磨かなくてよいものを磨き、直すべきものを見落とします。データ整備プロジェクトの最初の成果物は「きれいになったデータ」ではなく、「自社のデータがどんな状態かを示す診断結果」であるべきです。

範囲はユースケースから逆算する ― 全社棚卸しはしない

棚卸しと聞くと全社の文書を洗い出したくなりますが、それは終わりのない泥沼への入口です。対象は優先ユースケースで使うデータ領域だけに絞ります。社内FAQなら問い合わせ上位領域の規程・手順書だけ、営業支援なら現役で使う直近の提案書・事例だけ、経理の自動化なら対象プロセスの帳票・マスタだけ。さらに台帳は文書1点ずつではなく、「人事規程一式」「2024年度提案書フォルダ」のような文書群の単位で付けます。最初から細かくすると終わりません。

棚卸しの5軸と、収集の実務

対象領域の文書群は、次の5軸で台帳に記録します。

軸記録する内容AI活用上の意味
➀ 所在ファイルサーバ/SharePoint/Google Drive/SaaS内/個人PC/紙取り込みの経路と難易度が決まる
➁ 形式Word/Excel/PDF(テキスト・スキャン)/画像/チャットログ機械可読性=変換コストが決まる
➂ オーナー内容に責任を持つ部門・担当(不明なら「不明」と記録)正誤判断・更新の依頼先。不明は最大のリスク
➃ 鮮度最終更新日・更新頻度・失効日の有無古い情報の混入リスク
➄ 機微度公開/社内/部門限定/秘 + 個人情報フラグ権限設計の入力になる

収集は「聞く」と「スキャン」の両面から行います。各部門へのアンケートとヒアリングでは、個人保存・紙・暗黙知が拾えます。「それはどこに書いてありますか?」が属人化の検出質問です。一方で、ファイルサーバやSharePointの格納状況(ファイル数・形式・更新日の分布)はツールで機械的に集計します。例えばあるモデルケースでは、総務・人事領域の約1,400ファイルを集計したところ、スキャンPDFとExcel方眼紙が全体の約4分の1、3年以上更新されていないファイルが約3分の1を占めました。形式と更新日の2つの分布を見るだけでも、変換コストと陳腐化リスクの「当たり」が付きます。さらに「聞く」と「スキャン」を突き合わせると、使われているのに台帳にないものも浮かび上がります。

文書の健康診断 ― 4つの病気を診る

台帳ができたら、文書群の健康状態を4観点で診断します。➀重複: 同内容の文書が複数箇所・複数版で存在し、どれが正本か分からない。矛盾する回答の元になります。➁陳腐化: 失効した規程や古い価格が残っており、AIが古い情報を自信満々に回答する。➂非構造: Excel方眼紙やスキャンPDFなど、そもそも中身を取り込めない形式。➃属人化: 文書が存在せず、人の頭・メール・チャットにしかない。AIからは見えない=答えられない領域です。

全数調査は不要です。文書群ごとに10〜20点をサンプリングして開けば、群としての傾向はつかめます。あわせて、機微度と実際のアクセス権のズレも記録しておきます。「秘のはずの資料が全社共有フォルダにある」はよくある発見です。ただし、この時点では記録まで。場当たりで権限を張り直すと業務が止まるため、是正は権限設計を固めてから行います。

優先順位は「利用価値 × AI-ready距離」の2軸で決める

仕上げに、文書群ごとに機械可読性・鮮度・一意性・オーナー明確性・権限整合の5観点を3段階(0=問題なし/1=要作業/2=大工事)で採点し、合計を「AI-readyへの距離」とします。縦軸に利用価値、横軸にこの距離を取れば、着手順は自然に決まります。価値が高く距離が近い群から取り込んで早期に成果を出し、価値が高く距離が遠い群は計画的に整備する。価値が低く距離が近い群はついでに載せる。そして重要なのは、価値が低く距離が遠い群を明示的に「やらない」と決めることです。暗黙の先送りは、終わりのない全社整備の泥沼に戻ります。

Report

診断結果は経営向けに1〜2枚のレポートにまとめます。対象の全体像、4つの病気の分布、権限ズレの件数と代表例、優先順位と概算工数 ― 意思決定に要る数字だけに絞り、「かなり古い」ではなく「陳腐化5群/12群」のように数字で語ること。権限ズレのような火種は、整備計画とは分けて即時是正を提案します。

まとめ ― 診断フェーズでやること

  1. 整備の前に測定する。診断なしの整備は、労力を掛ける場所を誤る。
  2. 範囲は優先ユースケースから逆算し、文書群単位・5軸(所在・形式・オーナー・鮮度・機微度)で台帳化する。
  3. 4つの病気(重複・陳腐化・非構造・属人化)をサンプリングで診断し、権限ズレは記録まで。是正は設計後に行う。
  4. 価値×距離で優先順位を付け、「やらない」を明示し、経営レポート1〜2枚で報告する。

ここまで終えれば、「整備 → 活用 → 成果 → 次の整備」というループの初回が回り始めます。次回は「計画整備」と判定した文書群を、AIが読める形に整える実務を扱います。

本文中のファイル数・割合等の数値は説明のためのモデルケースであり、特定の企業の実データではありません。記載内容は2026年7月時点の情報に基づきます。