「A部長は全員に高い点を付ける」「B課長は誰にも4以上を付けない」。評価者ごとの甘辛は、どの会社でも起きます。問題は、それが感覚で語られていて、是正のしようがない点です。

評価結果はデータなので、偏りは数値で出せます。この記事では、何を見れば甘辛が分かるのか、AIに何を任せられるのかを整理します。

甘辛を測る4つの指標

指標 見るもの 偏りのサイン
平均点 評価者ごとの平均 全社平均から±0.5以上離れている
標準偏差 点数のばらつき 0.3未満=ほぼ全員同じ点を付けている
分布 各評語の人数割合 中央(B)に7割以上が集まっている
自己評価との差 本人評価と上司評価の乖離 常に上振れ/下振れしている

このうち最初に見るべきは標準偏差です。平均点が全社と同じでも、全員に同じ点を付けていれば評価として機能していません。

AIに任せられること・任せられないこと

任せられること

  • 評価者ごとの平均・分布・標準偏差の算出と、外れ値の指摘
  • 成果評価とプロセス評価の相関の確認(片方に引きずられていないか)
  • 前期からの変化の検出
  • 評価コメントの文面と点数の整合チェック(高評価なのに指摘ばかり、など)

任せられないこと

  • 偏りの理由の判断(本当に優秀な部署かもしれない)
  • 評価点の補正(機械的に調整すると評価の信頼が崩れる)
  • 評価者への指導

AIは「どこを見るべきか」を示すところまでです。判断と対話は人が行います。

数値の偏りが必ずしも問題ではない場合

分析結果を読むときに注意すべき点です。

  • 少人数の部署:3〜5名の部署では、偶然で平均が振れます。人数を併記して読んでください
  • 職種の違い:成果が数字で出る営業と、出にくい管理部門では分布が変わって当然です
  • 等級構成の違い:上位等級が多い部署は平均が上がります

このため、比較は「全社平均との差」だけでなく、同じ職種・同じ等級構成の部署同士で行うのが適切です。

評価会議での使い方

数値は、評価会議の材料として使うのが最も効果的です。進め方の例です。

  1. 評価会議の冒頭で、部署ごとの分布を一覧で示す
  2. 全社平均から大きく外れた部署の評価者に、理由を説明してもらう
  3. 説明が事実で裏づけられていれば、そのまま確定する
  4. 「なんとなく」であれば、根拠となる事実を再確認してもらう

重要なのは、点数を一律で調整しないことです。調整すると評価者は「どうせ直される」と考え、真剣に評価しなくなります。数値は議論の入口として使い、決めるのは評価者本人にします。

評価者研修との組み合わせ

分析で偏りが見つかったら、次期は評価者研修で目線を合わせます。効果があるのは、同じ事例を複数の評価者に評価してもらい、結果のズレをその場で見せる形式です。自分だけが甘い(辛い)ことが数字で分かると、自覚が生まれます。

評価エラーの種類と対策は人事評価のエラー11選、中心化傾向の詳細は評価者バイアス、評価者の育て方は評価者研修の設計で扱っています。

よくある質問(FAQ)

Q. 何人分のデータがあれば分析できますか? A. 評価者1人あたり5名以上が目安です。3名以下では偶然の影響が大きく、傾向として読めません。

Q. 分析結果を評価者本人に見せてもよいですか? A. 見せてください。ただし「あなたは甘い」と伝えるのではなく、全体の分布の中で自分がどこにいるかを示す形にします。

Q. 甘辛の補正を自動で行う機能は必要ですか? A. おすすめしません。自動補正は評価者の責任感を下げます。数値は議論の材料に留め、確定は評価会議で行うのが健全です。

Q. 過去データが無い状態でも分析できますか? A. 初回の評価からでも、評価者間の比較はできます。前期との比較は2期目以降になります。

評価者ごとの甘辛分析を標準機能として持つAI人事評価システム「Scale人事評価」では、評価会議にそのまま持ち込める形で分布を出力できます。AI活用の全体像はAI人事評価とは?をご覧ください。