Argus Wake Insights
AI時代の人事評価制度、何を変えて何を変えないか
要旨
- 結論
- AI全社導入済みの組織は「AIを使っているか」を評価軸から外し、成果量の増加分が報酬・等級に反映される仕組みと、質の劣化を検知する評価軸へ人事評価制度を更新すべきである。
- 根拠
- テックワーカーの51%が「同じ給与でより多くの成果を求められる」ことを最大の不安に挙げ(AIに仕事を奪われる不安の22%を大きく上回る)、深刻なバーンアウトは前年比11ポイント増の55.7%に達している。
- 決めること
- 次の評価サイクルの前に、AIで成果を出している層が成果に見合うリターンを得られていると認識しているかを経営として確認する。
なぜ2022年の「AI時代の人事評価」論はもう通用しないのか
「AI時代 人事評価制度」で検索すると、いまだに2022年前後の記事が上位に並ぶ。そこで語られているのは「AIを評価に取り入れるべきか」という導入是非の議論だ。だが2026年時点で全社導入済みの組織にとって、この前提はすでに過去のものである。問われているのは導入の是非ではなく、AIで成果量そのものが変わった従業員を、従来の評価軸のまま測り続けてよいのかという実務上の更新点だ。この空白を、海外の一次データを起点に埋める。
海外のデータは評価基準の何が問題だと示しているのか(元記事の具体的事実)
AIはテックワーカーをどう分断したのか ― バーンアウト55.7%・職種NPS -39の調査が示す人材マネジメントの課題が示す数字は、評価制度の設計不全を裏付けている。テックワーカーが最も恐れているのは「AIに仕事を奪われること」(22%)ではなく、「同じ給与でより多くの成果を求められること」(51%)だ。生産性は82%が向上を実感する一方、「速く、多く生産できるが質は上がっていない」という声が多数を占め、深刻なバーンアウトは前年比11ポイント増の55.7%に達している。
さらに重要なのは、AIで「増幅された」と自己評価する層(49%)と「不安定化した」層(14%)の間で、キャリア楽観度の差が最大の予測因子(Cohen’s dは約1.55、ファウンダーと非ファウンダーの差の約3倍)になっている点だ。これはツールの使いこなし度合いの差ではなく、成果を出した分がキャリアや報酬にどう返ってくるかという見通しの差である。評価基準を据え置いたまま「できる人はもっとやる」を放置すれば、増幅側のハイパフォーマーほど自分の市場価値を正確に把握しており、転職市場に流出する。
もう一つの手がかりが、Copilot のライセンス配布数は AI 導入の成功指標になるのか — Copilot Studio の実力とユーザー流出の実態にある。Microsoftは前四半期でCopilotシートを1000万追加した一方、個人ユーザーや開発者はClaudeやChatGPTへ流出し続けている。配布数を成功指標にした結果、実際の定着・利用率を見誤ったという構図だ。これは人事評価にも直結する示唆を持つ。「AIツールを使っているかどうか」を評価軸にするのは、Microsoftが陥った「配布数=利用実態」の錯覚と同じ罠であり、測るべきは利用有無ではなく成果への転化度合いである。加えて同記事が指摘するCopilot Studioの設計思想――小さくスコープを絞ったエージェント同士を呼び出し合わせて信頼性を担保する構成――は、評価の物差しにも転用できる。単一のプロンプト操作がうまいかではなく、複数のAIエージェントをどう役割分担させ、業務プロセス全体の成果に落とし込めているか。これが今後の評価で問うべき「AIエージェント活用」の中身であり、ツール利用の有無とは別次元の評価項目になる。
何を評価に残し、何を外すべきか ― 3つの判断軸
第一に、評価軸から外すべきは「AIを使っているかどうか」という利用有無の測定だ。全社導入済みの組織では利用は前提であり、Copilotのシート数が使われている証拠にならなかったのと同様、AI利用の有無は成果の証拠にならない。
第二に、残すべきは「成果量の増加分が報酬・等級にどう反映されているか」の可視化である。51%が恐れる「同じ給与でより多くの成果」を放置する等級制度は、増幅側の人材を静かに疲弊させ、外部への流出という形で組織にコストを跳ね返す。
第三に、新たに加えるべきは「質の劣化を検知する評価軸」だ。生産性実感82%の裏で「質は上がっていない」という声が併存している以上、アウトプット量だけでなく判断力・思考の深さを測る定性評価を、量的指標と並置する必要がある。あわせて、AIエージェントを複数組み合わせて業務を組み立てる設計力――どのタスクをどのエージェントに任せ、どこに人間の判断を残すか――を評価項目として明文化する組織はまだ少ない。速度への圧力が判断の質を削っている兆候を見逃さない仕組みと、この設計力を測る仕組みは表裏一体で整備すべきだ。
まとめ:制度を変える前に測るべきもの
評価制度を先に作り替える前に、まず自分の組織で測るべきは「AIで成果を出している層が、その成果に見合うリターンを得られていると認識しているか」の一点だ。マネージャーの質が依然としてバーンアウトの最大の決定要因であり、36.5%が自分の上司を非効果的と評価している現状を踏まえれば、制度設計だけでなく評価する側の運用力も同時に点検しないと、更新した基準はまた形骸化する。次の評価サイクルの前に、この一点を経営として確認できるかが分かれ目になる。
この論考への質問
AI時代の人事評価制度では何を変えるべきか?
「AIを使っているかどうか」という利用有無の測定を評価軸から外し、成果量の増加分が報酬・等級にどう反映されているかを可視化し、アウトプット量の裏で判断力・思考の深さが劣化していないかを検知する定性評価を量的指標と並置する。この3つが判断軸になる。
AIツールの利用有無を評価基準にしてはいけないのか?
全社導入済みの組織では利用は前提であり、MicrosoftのCopilotシート数が実際の利用実態を示さなかったのと同様、AI利用の有無は成果の証拠にならない。測るべきは利用有無ではなく成果への転化度合いであり、複数のAIエージェントを役割分担させて業務プロセス全体の成果に落とし込む設計力である。
AIで生産性が上がると従業員は何を不安に感じるのか?
最大の不安は「同じ給与でより多くの成果を求められること」(51%)で、AIに仕事を奪われる不安(22%)を大きく上回る。評価基準を据え置いたままでは、増幅側のハイパフォーマーほど自分の市場価値を正確に把握しており、転職市場に流出する。