ホーム/研究のまとめ

Research / 研究のまとめ

AIを使ってよいのは、
回答の正しさを判断できる人です

「全社員にAIを使わせれば、会社の生産性が上がる」と考える方は、まだ多くいます。
しかし、国内外の研究は別の結果を示しています。
AIの回答の正しさを判断できない人は、AIの誤りをそのまま採用します。
そして本人は、そのことに気づきません。

このページでは、AIの弊害と上手な使い方を調べた論文をもとに、AIを使ってよい人と、
会社がすべき教育をまとめました。

2026年10月8日に群馬県立前橋東高等学校で行う先生方向けセミナー(登壇予定)のテキストを、企業向けに書き直しました。

Summary

結論は3つです

  1. AIを使ってよいのは、その業務でAIの回答の正しさを判断できる人である

    線は「人」ではなく「業務」ごとに引きます。同じ人でも、専門の業務では判断でき、専門外の業務では判断できないからです。

  2. 回答の正しさを判断する力の土台は、表現力と読解力である

    判断できないままAIを使い続けると、この力は育たず、身につけた人でも衰えます。

  3. 会社がすべきことは、AIを配ることではなく、回答の正しさを判断できる社員を育てることである

    AIの使い方を教えるだけでは足りません。まず回答の正しさを判断する力を育て、判断できるようになった業務から、AIを使わせます。

01 / よくある誤解

「全社員がAIを使えば、生産性が上がる」は正しくない

この考えは、AIの回答が正しいことを前提にしています。しかしAIは、もっともらしく間違えます。 そのため、AIの成果は、AIの性能だけでは決まりません。使う人が回答の正しさを判断できるかどうかで決まります。

研究は、全社員に一律にAIを使わせると、次の3つが起きることを示しています。

  1. 誤りを採用する判断できない人は、AIのもっともらしい誤答をそのまま使う(03)
  2. 気づかない本人は、自分が正しさを判断できていないことに気づかない(05)
  3. 力が育たない判断する力そのものが育たず、身につけた人でも衰える(06)

「使い方の研修を全員に受けさせれば解決する」という考えも、研究では支持されていません。 使い方の説明を受けた人のほうが、AIの誤りを多く採用した実験があります(03)。

02 / 前提

AIは、もっともらしく間違える

生成AIは、もっともらしい文章を作るように作られています。そのため、AIの誤りは仕組みのうえで避けられません(㊻)。 そしてAIの誤りは、正しい回答と同じ口調で、同じくらい整った文章で出てきます。

  • 代表の田村が経営する群馬インターネットで、ある社員は、AIが作ったチャット文を読まずにコピーし、社長の田村に送りました。 チャット文の冒頭には、AIが付けた「次の回答文でどうでしょう。」という一言がそのまま残っていました。 その社員は、AIを使って文章が上手になったと思い込んでいました。
  • 米国の弁護士は2023年に、ChatGPTが作った実在しない判例を確認せずに裁判所へ提出しました。裁判所は、弁護士らに5,000ドルの制裁金を科しました。
  • ある学術論文は2024年に、冒頭にAIの返答文「Certainly, here is a possible introduction for your topic」を残したまま掲載されました。著者も査読者も編集者も、この一文に気づきませんでした。

弁護士も研究者も、AIの出力を確認しませんでした。これは、特別な人だけが起こす失敗ではありません。

社員の話をマンガにした「コピペ社員問題」を読む

参考にした論文と資料

03 / 判断できないと

正しさを判断できない人は、AIの誤りをそのまま採用する

ボストン コンサルティング グループのコンサルタント758人が参加した実験があります。 AIが苦手な課題では、AIを使ったコンサルタントの正答率は、AIを使わなかったコンサルタントより平均19ポイント低くなりました。 AIを使った人は、AIのもっともらしい誤答をそのまま採用しました。

図1
AIが苦手な課題での正答率
AIを使わない
84.5%
AIを使う
約70%
AIを使う
(使い方の説明あり)
約60%

使い方の説明を受けた人のほうが、正答率が低くなりました。使い方を知っていても、回答の正しさを判断できなければ、誤りは防げません。

⑱ Dell'Acqua他(2023)BCGのコンサルタント758人のフィールド実験

同じBCGのコンサルタントの使い方を分析した研究では、約27%がAIに作業を丸投げし、44%がAIの出力を修正せずに使っていました。

図2
コンサルタントのAIの使い方
作業をAIに丸投げした
約27%
出力を修正せずに使った
44%

㉞ Randazzo他(2024)BCGのコンサルタント200人超

参考にした論文

04 / 判断できる人

AIの誤りを見抜ける人は、少ない

英国のビジネススクールの2年生211人に、AIの誤った回答を見せる評価がありました。誤りを見抜けた学生は、約2割でした。 見抜けた学生は、文章力と読み解く力を持っていました。暗記した知識の量は、見抜く力につながりませんでした。

図3
AIの誤った回答を見抜けた大学生は、10人に2人

㊺ Dang, Nguyen(2025)英国の大学生211人

日本では、基礎的な読解力の調査で基準を満たした生徒は、高校生で27%、中学生で42%でした。 国立情報学研究所の新井紀子氏は、AIの誤りに気づけるのは、読解力とファクトチェックの力と専門性がそろった人だけだと指摘しています。

図4
基礎的読解力の基準を満たした生徒(1マスが1%)

27%高校生(1,139人)

42%中学生(857人)

㊻ 新井紀子(2024)文部科学省資料

数年後に入社してくる人の多くは、AIの回答を正確に読み取る力を、まだ身につけていません。

参考にした論文

05 / 錯覚

本人は、正しさを判断できていないことに気づかない

AIを使って論理問題20問を解いた人は、自分の正解数を約17問と見積もりました。実際の正解数は約13問でした。 成績の良し悪しに関係なく、全員が自分の実力を高く見積もりました。AIに詳しい人ほど、見積もりの正確さはむしろ低くなりました。

図5
論理問題20問の正解数(AIを使った人)
本人の見積もり
約17問
実際の正解
約13問

約4問分の過大評価。目盛りは0〜20問。

⑨ Fernandes他(2026)米国の成人、2つの実験

  • 知識労働者319人の調査では、AIを信頼している人ほど、批判的に考えていませんでした(⑰)。
  • プログラミングでつまずいている学生は、AIを使って「できたつもり」になったまま終わりました(⑪)。

だから、「AIを使ってよいか」を本人の自己申告で決めることはできません。会社が、判断する力を確かめる必要があります。

06 / 長く使うと

正しさを判断できないまま使うと、判断する力が育たず、衰える

AIを使うと、成果物は良くなります。しかし、使った人の力は落ちます。 中国の中高生約2.7万人を30か月追跡した研究では、AIを使った生徒の宿題の点数は上がり、試験と入試の点数は下がりました。 成績の低下は、宿題をAIに任せて短時間で済ませた生徒に集中していました。

図6
AIを使った中高生の点数の変化
宿題
+18%
試験(6か月後)
−20%
入試(2年後)
−18〜24%

成果物(宿題)は良くなり、AIなしで試される力(試験と入試)は落ちました。入試の棒の薄い部分は幅(18〜24%)を示します。

① Strömberg, Lei, Wu(2026)中国の中高生26,811人

高校生約1,000人の研究では、答えを教えるAIを使った生徒は、AIを取り上げられた後の試験で、AIを使わなかった生徒より17%低い成績を取りました。 ヒントだけを出すAIを使った生徒には、この悪影響がほぼ見られませんでした。

図7
AIを使わなかった生徒と比べた成績の差

練習中(AIあり)

答えを教えるAI
+48%
ヒントを出すAI
+127%

AIを取り上げた後の試験

答えを教えるAI
−17%
ヒントを出すAI
ほぼ0

練習中の「ヒントを出すAI」の成績が高いのは、ヒントに正解が組み込まれていて答え合わせができたためです。

③ Bastani他(2025)PNAS、トルコの高校生約1,000人

若手社会人と、ベテランの専門家でも同じことが起きています。

図8
初めて使う技術の理解度テスト(若手エンジニア52人)
自分で作業
67%
AIで作業
50%

⑯ Shen, Tamkin(2026)Anthropic

図9
AIなしで行った検査の腺腫発見率(ベテラン内視鏡医19人)
AI導入前
28.4%
AIに慣れた後
22.4%

⑲ Budzyń他(2025)観察研究

AIを使っても、理解度テストの点数が高かったエンジニアもいました。AIに「なぜそうなるか」を質問し、実装は自分で行った人たちです(⑯)。 つまり、判断する力が育つかどうかは、AIに考えを預けるか、自分で考えるかで決まります。

参考にした論文

07 / 判断する力の正体

回答の正しさを判断する力の土台は、表現力と読解力である

表現力とは、読み手がすぐに理解できる文章を書く力です。ここでいう読み手とは、忙しい上司やお客さまのように、文書を短い時間で読んで判断を下す人です。 読解力とは、書かれている内容を正確に読み取る力です。

AIを使う人は、部下と上司の二つの立場を同時に担います。

判断できない人は、確かめること自体をやめます。そして、次の3段階で転落します。 02で紹介した社員は、この3段階をすべて踏んでいました。

  1. 考えない自分で文章を組み立てずに、AIに書かせる
  2. 読まないAIの出力を読み通さない
  3. 確認しない内容の正誤も、AIの前置きや定型文も確かめずに使う

AIに伝わる文章は、上司に伝わる文章と同じである

AIへの指示にも、ビジネス文書と同じ書き方が求められます。

  • 何をしてほしいかを最初に明示する。
  • あいまいな表現を使わず、単文で言い切る。
  • 読み手に行間を読ませたり、察してもらったりすることを前提にしない。

AI開発企業のAnthropic社も、AIを「優秀だが、職場の決まりや仕事の流れを知らない新入社員」とみなして指示を書くよう勧めています。

察してもらう前提の指示 A社に行ってきた。新システムに興味はあるみたいだけど、予算は来期らしい。いい感じにまとめて。
結論と依頼を先に書いた指示 上司への報告メールを書いてください。A社を訪問した。先方は新システムに関心を示した。予算化は来期になる。結論を最初に書き、200字以内にする。

注:指示の順序の効果は、研究では確定していません。使うAIと業務で確かめてください。

なぜ、社員はこの書き方を知らないのか

高校の必修科目「現代の国語」が、報告書・企画書・電子メールなどの実用的な文章を扱い始めたのは、2022年度からです。 今の社会人の多くは、学生時代にこの書き方をほとんど習っていません。慣れているのは、起承転結の作文です。 起承転結は作文指導の慣習であり、学習指導要領が定めた書き方ではありません。

だから、結論を先に書き、言い切る書き方は、会社が意識して教える必要があります。

参考にした論文と資料

08 / 反対の結果を示す研究

AIで新人が伸びた研究もある。ただし、測ったものが違う

公平のために、反対の結果を示す研究も紹介します。 コールセンターの担当者5,179人にAIアシスタントを導入した研究では、経験の浅い担当者の生産性が34%上がりました。 大学生170人の研究では、文章が苦手な学生ほど、AIを使ったときの文章の質が大きく上がりました。

図10
AI導入後の生産性の伸び(コールセンター)
経験の浅い担当者
+34%
全体の平均
+14%
熟練した担当者
ほぼ0

㉖ Brynjolfsson, Li, Raymond(2025)

図11
AIを使ったときの小論文の点数の伸び(人の評価)
文章が苦手な学生
+13.93点
文章が得意な学生
+1.72点

㊾ Tukachinsky Forster他(2025)

この2つの研究は、ここまでの研究と矛盾しません。測ったものが違うからです。

AIで伸びた研究(図10・11) AIで力が落ちた研究(図6〜9)
測ったもの AIを使ったときの成果物 AIなしで試される本人の力
回答の正しさ 業務が定型的で、正しさを会社の仕組みで担保しやすい(コールセンター)。または正誤を問わない(小論文の読みやすさ) 本人が判断しなければならない

つまり、正しさを仕組みや判断できる人が担保できる業務なら、AIは新人の成果物を良くします。 しかし、そのことは、新人が判断する力を身につけたことを意味しません。

参考にした論文

09 / フィネットの提案

AIを使ってよいかは、業務ごとに決める

AIを使ってよいのは、その業務で、AIの回答の正しさを判断できる人です。

「回答の正しさを判断できる」とは、AIの回答を読んで、内容が正しいか、足りないものはないか、余計な一文が入っていないかを、自分の知識で確かめられることです。

線を「人」ではなく「業務」で引く理由は、同じ人でも業務によって判断できるかが変わるからです。 03のコンサルタントは、AIが得意な課題では成果物の品質を40%以上高めました。同じコンサルタントが、AIが苦手な課題では正答率を19ポイント落としました。 AIの得意と不得意の境目は凸凹で、外からは見えません。

図12
同じコンサルタントでも、課題によって結果が逆になる
AIが得意な課題
(成果物の品質)
+40%超
AIが苦手な課題
(正答率)
−19ポイント

単位が異なる(品質は%、正答率はポイント)ため、棒の長さは向きを示す目安です。

⑱ Dell'Acqua他(2023)

業務ごとに、判断できる人から使い始める

  1. 土台を育てる表現力と読解力、そしてその業務の基礎知識を教育で育てる
  2. 判断する力を確かめるその業務で、誤りを含むAIの回答を読ませ、見抜けるかを確かめる
  3. その業務で利用を認める確かめた業務に限って、AIの利用を認める
  4. 業務を広げる次の業務でも同じ手順を踏み、使える範囲を広げる

判断できない業務でAIを使う場合は、その業務で判断できる人が、AIの回答を確かめてから使います。 判断できる人がいない業務では、AIを使いません。

注:この手順は、ここまでの研究をもとにフィネットが考えた提案です。手順そのものの効果を直接検証した研究ではありません。

10 / 会社がすべき教育

使い方を教えるだけでは、社員は実行しない

研究は、判断する力を育てるAIの使い方を3つ示しています。

まず自分で考え、その後でAIを使う

先に自分でアイデアを出した学生は、AIを使わない課題でも独創性を保ちました(㉚)。

「私の案はこれ。改善点を教えて」

答えではなく、説明やヒントを求める

説明だけを受けて自分で判断した人は、判断の仕方を学べました(③㉛)。

「答えではなく、ヒントだけ教えて」

間違えたときこそ、AIで振り返る

AIの効果が最も大きく出たのは、間違えた後でした(⑤)。

「どこで間違えたかを一緒に確かめて」

しかし、良い使い方を知っても、人は楽な使い方を選びます。

図13
考えさせる設計のAIチューターを使った中学生(2年間)
一度は試した
96%
間違えたときに使った
17%

④ Oreopoulos, Low(2026)NBER Working Paper

そのため会社は、楽な道と力がつく道が同じになるように、仕事の任せ方と評価の仕方を設計する必要があります。

仕事の任せ方

AIを使っても、本人が考えなければ通らない頼み方をします。 たとえば、AIで作った資料を受け取るときに、要点と結論の理由を本人の言葉で説明してもらいます。

評価の仕方

成果物の見た目ではなく、AIを使わずに説明し、判断できる力で評価します。 成果物の出来だけで評価すると、社員にとっては仕事をAIに任せることが合理的な選択になるからです(①)。

使い始める場

考えさせるAIを、指導者の目が届く場で使い始めます。 学習科学に基づいて設計したAIチューターは、授業の2倍を超える学習効果を示しました(㉘)。 教師が進行役を務めた学習では、6週間で通常の学校教育1.5〜2年分の伸びが出ました(㉝)。

土台が弱い社員 土台が強い社員
主なリスク 力がそもそも育たず、差が開く AI任せにすると、持っている力を失う
守り方 仕組みで守る。指導者の目が届く場でAIを使う 自己点検の習慣で守る。まず自分で考え、AIを使わずに確かめる

注:仕事の任せ方と評価の仕方は、研究(①)をもとに考えた実践案です。効果を直接検証した研究ではありません。

AIを禁止する必要はない

判断できる人にとって、AIは強力な道具です。自分で考える社員にとって、いつでも質問に答えるAIは、激安の家庭教師にもなります。 大切なのは、AIを使う前に判断する力を育て、判断できる業務から使うことです。

参考にした論文

11 / 経営者と管理職

経営者と管理職も、正しさを判断できない業務でAIを使えば誤る

上に立つ人のAIの使い方は、社員にとって最も身近な手本になります。次の3つを守ります。

  • 自分でファクトチェックできる範囲でAIを使う。AIの誤りに気づけるのは、読解力と専門性のある人だけです(㊻)。
  • 部下の評価や見取りをAIに丸投げしない。丸投げすれば、06の内視鏡医と同じように、人を見る力が落ちます(⑲)。
  • AIの使い方で社員の手本になる。社員は、上司がAIをどう使うかを見ています。

参考にした論文

Our approach

フィネットは、回答の正しさを判断できる人を育てる教育から始めます

AI活用の研修をご依頼いただいた場合でも、初日にはタッチタイピングの時間を取ります。
そのうえで、結論を先に書く表現力と、
例外を漏らさず組み立てる論理的思考力を、書いて直される往復で鍛えます。
AIを業務で使うのは、その業務で回答の正しさを判断できるようになってからです。

References

引用した研究と資料

番号は、フィネットの研究一覧の通し番号です。角かっこ内は研究の種類と査読の有無です。
査読前の論文や観察研究は、結論が今後変わる可能性があります。

  • ① Strömberg, Lei, Wu (2026) The Generative AI Learning Penalty. CEPR Discussion Paper 21577[追跡データの分析/査読前]
  • ③ Bastani他 (2025) Generative AI without guardrails can harm learning. PNAS 122(26)[フィールド実験/査読あり]
  • ④ Oreopoulos, Low (2026) One Click Away: AI Tutoring with Khanmigo. NBER WP 35620[フィールド実験/査読前]
  • ⑤ Oreopoulos他 (2026) Making AI Tutoring Productive. NBER WP 35621[フィールド実験/査読前]
  • ⑨ Fernandes他 (2026) AI makes you smarter but none the wiser. Computers in Human Behavior 175[実験/査読あり]
  • ⑪ Prather他 (2024) The Widening Gap. ICER 2024[質的研究/査読あり]
  • ⑯ Shen, Tamkin (2026) How AI assistance impacts the formation of coding skills. arXiv:2601.20245[ランダム化比較試験/査読前]
  • ⑰ Lee他 (2025) The Impact of Generative AI on Critical Thinking. CHI 2025[調査/査読あり]
  • ⑱ Dell'Acqua他 (2023) Navigating the Jagged Technological Frontier. HBS Working Paper(Organization Science 掲載)[フィールド実験/査読あり]
  • ⑲ Budzyń他 (2025) Endoscopist deskilling risk after exposure to AI in colonoscopy. Lancet Gastroenterol Hepatol[観察研究/査読あり]
  • ㉖ Brynjolfsson, Li, Raymond (2025) Generative AI at Work. Quarterly Journal of Economics 140(2)[準実験/査読あり]
  • ㉘ Kestin他 (2025) AI tutoring outperforms in-class active learning. Scientific Reports 15[ランダム化比較試験/査読あり]
  • ㉚ Wong, Qiu (2026) Think First, ChatGPT Later. Educational Psychology Review 38[実験/査読あり]
  • ㉛ Gajos, Mamykina (2022) Do People Engage Cognitively with AI? IUI 2022[実験/査読あり]
  • ㉝ De Simone他 (2025) From Chalkboards to Chatbots. World Bank PRWP 11125[ランダム化比較試験/査読前]
  • ㉞ Randazzo他 (2024) Cyborgs, Centaurs and Self-Automators. HBS Working Paper[質的研究+実験データ/査読前]
  • ㊺ Dang, Nguyen (2025) Distinguishing Fact from Fiction. arXiv:2506.00050[観察研究/査読前]
  • ㊻ 新井紀子 (2024) 生成AIの教育に及ぼす影響について. 文部科学省資料[調査データと見解/査読なし]
  • ㊾ Tukachinsky Forster, Kee, Li (2025) From digital divide to equity-enhancing diffusion. AI & Society[実験/査読あり]
  • Anthropic「Prompting best practices」
  • 中学校・高等学校学習指導要領(平成29・30年告示)
  • Mata v. Avianca事件(米国ニューヨーク南部地区連邦地裁、2023年6月22日)、Surfaces and Interfaces誌掲載論文(2024年)