この記事の結論
- 分類の設計は精度の議論ではなく、誤分類の影響を見積もることから始まります
- 間違える方向によって損害が違うため、分類ごとに扱いを変えてください
- 全件を自動化せず、迷ったものを人に回す境目を作るのが現実的です
問い合わせをどの担当に振り分けるか、投稿が規約に触れていないか、書類がどの種類か。こうした仕分けの作業は、件数が増えると担当者の時間を大きく奪います。AIに任せたいという相談が多いのも当然です。
ただ、この領域では「どのくらいの精度が出ますか」という問いから話が始まることが多く、これがあまり良い出発点ではありません。より先に決めるべきなのは、間違えたときに何が起きるかです。本記事では、その見積もり方と、人が確認する境目の引き方を整理します。
分類の定義を先に固める
実装より前に、分類の種類そのものを見直す価値があります。現場で運用されている仕分けは、たいてい次のような課題を抱えています。
- 種類が重なっている:「技術的な問い合わせ」と「不具合の報告」が両方あり、どちらにも当てはまる案件が多い
- 種類が足りない:どこにも当てはまらないものが「その他」に集まり、結局人が見ている
- 基準が担当者の頭の中にある:文書化されておらず、人によって振り分け先が違う
三つ目が特に厄介です。人によって判断が違う仕分けは、AIに任せても安定しません。何を正解とするか決められないからです。この場合、まず数十件の実例を並べて担当者同士で答え合わせをし、判断がぶれる箇所を洗い出す作業から始めます。この作業だけで、自動化しなくても仕分けの品質が上がることもあります。
種類を定義するときの目安は、重なりがないこと、全部で十数種類を超えないこと、そして**「分類できない」という選択肢を必ず置くこと**です。無理にどれかへ押し込む設計は、後で最も困る形になります。
誤分類の影響を種類ごとに見積もる
分類の誤りは一様ではありません。どちらに間違えたかで影響がまったく違います。
例として、投稿が規約に違反しているかを判定する場合を考えます。
| 誤りの向き | 起きること | 損害の性質 |
|---|---|---|
| 違反でないものを違反と判定 | 正常な投稿が止まる | 利用者の不満、問い合わせの増加 |
| 違反なのに問題なしと判定 | 不適切な投稿が公開される | 被害の発生、信用の毀損 |
この二つは同列に扱えません。多くの場合、後者の方が損害が大きいため、判定は「疑わしければ人が確認する側に倒す」設計になります。逆に、社内の文書を種類分けするだけであれば、どちらの誤りも修正可能で、損害はほぼ同じです。
見積もりの手順としては、分類の種類ごとに次を書き出してください。
- この種類に誤って入れられたとき、何が起きるか
- この種類から誤って外れたとき、何が起きるか
- その誤りに、誰かが後の工程で気づく機会があるか
- 気づいたとき、どこまで巻き戻せるか
三つ目と四つ目が、自動化の可否を大きく左右します。誤りが必ず後工程で目に触れ、簡単に直せる業務であれば、多少の誤分類は運用で吸収できます。一方、誤ったまま顧客へ届いて取り返しがつかない業務は、精度が高くても全自動にすべきではありません。
人が確認する境目を作る
現実的な設計は、全件自動でも全件手動でもなく、迷ったものだけを人に回す形です。境目の作り方をいくつか挙げます。
確信の度合いで分ける。モデルに分類と同時に確信の度合いを出させ、低いものを人の確認待ちに回します。ただし、AIが出す確信の度合いは目安であり、統計的に保証された値ではありません。運用前に、実データで「確信が低いと言われたものは実際に間違いが多いか」を確かめてから使ってください。確かめずに使うと、根拠のない数字で自動化の範囲を決めることになります。
種類で分ける。影響の小さい種類は自動で確定させ、影響の大きい種類だけ人が確認します。「広告の問い合わせは自動、解約の申し出は必ず人」のような分け方です。境目が説明しやすく、運用も安定します。個人的には、まずこの方法から試すことをおすすめします。
二段階にする。まず粗く振り分けて担当チームに渡し、細かい判断はその担当が行う構成です。AIが担うのは最初の一段だけになり、誤りの影響も一段分に収まります。
期間で分ける。導入初期は全件を人が確認し、結果を見ながら自動確定の範囲を広げます。最初から全自動にせず、信頼を積んでから範囲を広げる進め方です。
規則とAIを組み合わせる
すべてをAIに任せる必要はありません。むしろ、確実に決まる部分は規則で判定する方が、速く、安く、説明もできます。
- 送信元のドメイン、問い合わせフォームの選択項目、添付ファイルの種類などは規則で確定できます
- 特定の語句が含まれる場合に必ず人の確認へ回す、といった安全弁も規則で書けます
- 規則で決まらなかったものだけをAIに渡します
この構成には副次的な利点があります。なぜその分類になったかを説明できる割合が増えるため、現場からの「どうしてこれがここに入ったのか」という問いに答えやすくなります。
想定例:ある企業が、問い合わせを五種類に自動振り分けする仕組みを入れたとします。当初は全件をAIに任せていましたが、フォームで選択された種別を無視して文面だけで判定していたため、明らかな案件でも誤りが出ていました。フォームの選択がある場合はそれを優先し、自由記述のみの場合にAIを使う構成に変えたところ、誤りが減り、現場の納得も得られました。
直せる形と、数えられる形
分類結果は、担当者が画面上で直せるようにしておきます。直せない自動化は、一度誤ると現場が回避策を編み出し、やがて機能そのものが無視されます。
そして、直された件数を記録してください。これが運用開始後のもっとも確かな手がかりになります。どの種類が、どの種類に直されることが多いか。この集計があれば、定義の見直しが必要な箇所や、人の確認へ回すべき範囲が見えてきます。記録がなければ、現場が不満を溜めていることに気づけません。
自動化しない判断も選択肢です
相談を伺っていて、「この業務は自動化しない方がよい」とお伝えすることもあります。件数が少なく担当者の負担が小さい場合、判断基準が固まっていない場合、誤りの損害が大きく人の確認をどのみち全件行う場合。こうした状況では、仕組みを入れても手間が増えるだけになりがちです。
判断が固まっていない業務については、先に基準を文書化する作業をおすすめします。その作業自体が現場の品質を上げますし、後から自動化する場合の準備にもなります。
分類の自動化が自社の業務に見合うかの整理から、AI活用開発・Webシステム開発としてご相談を承ります。お問い合わせよりご連絡ください。ご相談・お見積りは無料です。
本記事は一般的な情報であり、個別の事案は専門家・所管官庁にご確認ください。
チェックリスト
- 分類の種類を、重なりのない形で定義したか
- どちらに間違えると困るかを種類ごとに書き出したか
- 誤分類が後の工程で気づけるか確認したか
- 人が確認する対象を決める基準を定めたか
- 「分類できない」という選択肢を用意したか
- 分類結果を人が直せる画面を用意したか
- 直された件数を後から数えられるようにしたか
よくあるご質問
分類の精度はどのくらい必要ですか?
業務によって答えが変わります。誤分類が後の工程ですぐ気づける業務なら低めでも回りますし、そのまま顧客に届く業務なら高い水準でも自動化は避けた方が無難です。必要な精度は、誤りの影響から逆算して決めてください。
AIの分類とルールによる分類はどちらがよいですか?
用途で使い分けます。キーワードや送信元で確実に決まるものは規則で判定する方が速く、安く、説明もできます。文面の意図や内容の性質など、規則で書き切れないものにAIが向きます。両方を組み合わせる構成が実務的です。
分類を全自動にしてよいのはどんな場合ですか?
誤分類の損害が小さく、後の工程で気づける場合です。たとえば表示の並び順を決めるための分類なら、間違っても影響は限定的です。権利や金銭、安全に関わる判断は全自動を避け、人の確認を挟む設計をおすすめします。
関連する記事
- AI活用要約機能を作るときの設計AIによる要約機能をWebサービスに組み込むときの設計を整理します。何のための要約かの定め方、長さと粒度の制御、要約できない入力への対応、そして要約の誤りが業務に与える影響の見積もり方をまとめます。
- プロダクトSNS・コミュニティサービスの設計 — 投稿・モデレーション・安全性SNSやコミュニティサービスは、投稿・フォロー・通知の基本構造に加え、モデレーションと安全性の設計が成否を分けます。通報・自動検知・人の確認の組み合わせ、規約とガイドライン、初期の立ち上げとスケール時の注意点を整理します。
- グロース・収益化プロダクトのKPI設計とダッシュボード — 見るべき指標を絞る北極星指標を起点に先行指標・遅行指標へ分解し、PMF前後のフェーズに応じて見るKPIを絞る考え方と、意思決定に使えるダッシュボードの設計、計測の信頼性、やりがちな失敗を整理します。
関連するサービス
監修: フィリット・コンサルティング株式会社公開