技術文書や規格書をLLMに読ませる際は、「読めているように見えて、実は正しく解釈されていない」状態を前提に運用する必要があります。一般的な文章の要約と異なり、技術文書には単位・図表・改訂履歴・条件付きの記述といった、誤読が致命的になる要素が多く含まれます。本記事では、実務で問題になりやすい点と、その回避方法を整理します。

なぜ技術文書は誤読されやすいのか?

結論から言えば、技術文書の情報の多くが、本文以外の場所に置かれているためです。表、図、脚注、単位系の定義、参照先の別規格——これらを切り離すと、本文の記述だけでは意味が確定しません。

たとえば「最大圧力は10とする」という一文があったとして、単位が表のヘッダにしか書かれていなければ、本文だけを読んでも値の意味は決まりません。人間はページ全体を視野に入れて補完しますが、テキストとして抽出された時点でその対応関係が失われることがあります。

さらに、技術文書には次のような特徴があります。

  • 条件付きの記述が多い:「ただし〜の場合を除く」「〜に適合する場合に限り」といった但し書きが、結論を反転させます。
  • 参照が入れ子になっている:ある規格が別の規格を引用し、その規格がさらに別を引用する構造が一般的です。
  • 改訂によって内容が変わる:同じ番号の規格でも、版が違えば要求事項が異なります。
  • 用語が厳密に定義されている:日常語と同じ単語でも、その文書内では特定の意味に限定されている場合があります。

これらは、一般的な文章を要約する場面では問題になりにくい特性です。技術文書に固有のリスクとして、意識的に対処する必要があります。

PDFの取り込みで何が失われるのか?

技術文書はPDF形式で配布されることが大半ですが、PDFからテキストを抽出する過程で、構造の情報が落ちます。

失われやすいもの起きる問題
表の行と列の対応どの値がどの条件に対応するか不明になる
図中の文字と図形の関係寸法線や矢印の指す対象が失われる
段組みの読み順2段組みの左右が交互に混ざる
上付き・下付き文字指数や化学式が平坦な文字列になる
脚注との対応本文中の注記番号と脚注が結びつかない
ヘッダ・フッタ本文中に版番号やページ番号が混入する

特に注意したいのが上付き文字です。単位の「m3」が「m3」に、「10-6」が「10-6」になると、値の桁が変わります。数式や化学式を含む文書では、抽出結果を必ず目視で確認してください。

また、スキャンされた画像PDFの場合は、そもそもテキストが存在しません。この場合はOCR(文字認識)を経由することになり、そこでさらに誤認識が加わります。数字の「0」と英字の「O」、「1」と「l」の混同は典型例です。

近年のLLMは画像として文書を読める場合もありますが、複雑な表や図面の読み取り精度は文書によって差があります。重要な数値については、抽出方式によらず原本と照合する運用が前提になります。

数値と単位はどう扱うべきか?

単位換算をLLMに任せないでください。これが最も明確な注意点です。

換算そのものは単純な計算ですが、問題は入力段階にあります。文書から抽出された数値の単位が正しく認識されていなければ、換算結果は当然誤ります。そして出力は自然な形式で提示されるため、誤りに気づきにくくなります。

実務で問題になりやすいのは次のような場面です。

  • ゲージ圧と絶対圧:同じ「圧力」でも基準が異なり、表記が省略されている文書もあります。
  • 質量濃度と体積濃度:どちらも「%」や「ppm」で表記され、文脈からしか区別できません。
  • 同名の異なる単位:分野や地域によって定義が異なる単位があります。
  • 桁の区切り:小数点にカンマを使う表記との混同で、桁が変わります。

推奨する運用は、LLMには「どこに何が書いてあるか」を探させ、数値の解釈と計算は自分で行うという分担です。文書中から該当箇所を見つけ出す作業は大幅に効率化できますが、そこから先の判断は人間が持つべき責任範囲になります。

規格の版と改訂をどう管理するか?

規格書を扱ううえで、版の取り違えは最も影響が大きい誤りです。要求値そのものが変わっている場合、それに基づく判断がすべて誤ります。

注意すべきなのは、LLMが学習時点の知識から回答を生成する可能性がある点です。手元の文書を読ませたつもりでも、文書に書かれていない内容を、一般的な知識から補って回答することがあります。この場合、回答は自然に読めてしまい、出典を確認しなければ判別できません。

  • 回答に必ず該当箇所を引用させる:「どの章のどの条項に書かれているか」を併記させると、文書内に根拠があるかを確認できます。
  • 版番号と発行年を明示する:プロンプトの冒頭で、扱っている文書の版を明記します。
  • 「文書に記載がない場合はその旨を答える」と指示する:推測での補完を抑制できます。
  • 複数版を同時に読ませない:新旧が混在すると、どちらの記述か判別できなくなります。

なお、規格書には著作権があり、多くは複製や外部への送信が許諾範囲外です。購入した規格書であっても、外部のサービスへアップロードしてよいとは限りません。利用許諾条件を確認し、必要であればローカル環境での処理を検討してください。ローカルLLMの構築についてはローカルLLM(Ollama等)を研究データ解析に使うで解説しています。

実務ではどう使い分けるべきか?

誤読リスクを踏まえると、用途によって任せてよい範囲が変わります。

用途適性理由
該当箇所の検索・絞り込み高い誤りがあっても原本で確認するため影響が小さい
長文の概要把握高い詳細は後で確認する前提で使える
専門用語の説明中程度文書内の定義と一般的な定義が異なる場合がある
複数文書の比較・差分抽出中程度候補の洗い出しには有効だが結果の検証が必要
数値の抽出・換算低い誤りが結果に直結し、気づきにくい
適合性の判断・可否の結論低い但し書きや例外条項の見落としが致命的になる

整理すると、「探す」「絞る」「下読みする」までは大きく効率化でき、「決める」は人間が行うという線引きになります。この線を越えると、確認に要する労力が効率化分を上回ります。

特に、安全に関わる判断、法令や規制への適合性の判断については、最終的な確認を省略しないでください。誤った判断が事故や不適合につながる領域では、効率より確実性が優先されます。

よくある質問

RAGを使えば誤読は防げる?

出典を明示できるため、根拠の確認はしやすくなります。ただし、文書を分割して検索する仕組み上、表と単位定義が別の断片に分かれる、但し書きだけが取り残されるといった問題は残ります。RAGは有効な手段ですが、確認を不要にするものではありません。

図面や寸法図は読み取れる?

単純な図であれば概要を把握できる場合がありますが、寸法線の対応関係や公差の指示、断面の表現などは誤読が起きやすい領域です。図面の解釈を根拠に判断することは避け、原図での確認を前提としてください。

社内の技術文書なら安心して使える?

著作権の制約は緩和されますが、機密性の問題は残ります。未公開の技術情報を外部サービスへ送信してよいかは、所属組織の情報管理規程で決まります。技術的に可能かどうかとは別に、必ず規程を確認してください。

誤読を減らすプロンプトの工夫はある?

回答に該当箇所の引用を必ず含めさせること、記載がない場合はその旨を答えるよう指示すること、扱う文書の版を明示することが基本になります。また、質問を細かく分けて一度に一つの論点だけを尋ねる方が、複合的な質問より誤りが減る傾向があります。

まとめ

技術文書をLLMに読ませる際は、PDF抽出で構造が失われること、数値と単位の解釈に誤りが混入しうること、文書外の知識で補完される可能性があること——この3点を前提に運用を組み立ててください。

そのうえで、探索や下読みには積極的に使い、数値の確定と可否の判断は人間が担う。この分担であれば、確認の手間を抑えつつ、実務的な効率化が得られます。

なお、扱う文書の著作権と機密性については、技術的な可否とは別に必ず確認が必要です。この点は効率化の議論より優先される前提条件になります。