「A部長は全員に高い点を付ける」「B課長は誰にも4以上を付けない」。評価者ごとの甘辛は、どの会社でも起きます。問題は、それが感覚で語られていて、是正のしようがない点です。
評価結果はデータなので、偏りは数値で出せます。この記事では、何を見れば甘辛が分かるのか、AIに何を任せられるのかを整理します。
甘辛を測る4つの指標
| 指標 | 見るもの | 偏りのサイン |
|---|---|---|
| 平均点 | 評価者ごとの平均 | 全社平均から±0.5以上離れている |
| 標準偏差 | 点数のばらつき | 0.3未満=ほぼ全員同じ点を付けている |
| 分布 | 各評語の人数割合 | 中央(B)に7割以上が集まっている |
| 自己評価との差 | 本人評価と上司評価の乖離 | 常に上振れ/下振れしている |
このうち最初に見るべきは標準偏差です。平均点が全社と同じでも、全員に同じ点を付けていれば評価として機能していません。
AIに任せられること・任せられないこと
任せられること
- 評価者ごとの平均・分布・標準偏差の算出と、外れ値の指摘
- 成果評価とプロセス評価の相関の確認(片方に引きずられていないか)
- 前期からの変化の検出
- 評価コメントの文面と点数の整合チェック(高評価なのに指摘ばかり、など)
任せられないこと
- 偏りの理由の判断(本当に優秀な部署かもしれない)
- 評価点の補正(機械的に調整すると評価の信頼が崩れる)
- 評価者への指導
AIは「どこを見るべきか」を示すところまでです。判断と対話は人が行います。
数値の偏りが必ずしも問題ではない場合
分析結果を読むときに注意すべき点です。
- 少人数の部署:3〜5名の部署では、偶然で平均が振れます。人数を併記して読んでください
- 職種の違い:成果が数字で出る営業と、出にくい管理部門では分布が変わって当然です
- 等級構成の違い:上位等級が多い部署は平均が上がります
このため、比較は「全社平均との差」だけでなく、同じ職種・同じ等級構成の部署同士で行うのが適切です。
評価会議での使い方
数値は、評価会議の材料として使うのが最も効果的です。進め方の例です。
- 評価会議の冒頭で、部署ごとの分布を一覧で示す
- 全社平均から大きく外れた部署の評価者に、理由を説明してもらう
- 説明が事実で裏づけられていれば、そのまま確定する
- 「なんとなく」であれば、根拠となる事実を再確認してもらう
重要なのは、点数を一律で調整しないことです。調整すると評価者は「どうせ直される」と考え、真剣に評価しなくなります。数値は議論の入口として使い、決めるのは評価者本人にします。
評価者研修との組み合わせ
分析で偏りが見つかったら、次期は評価者研修で目線を合わせます。効果があるのは、同じ事例を複数の評価者に評価してもらい、結果のズレをその場で見せる形式です。自分だけが甘い(辛い)ことが数字で分かると、自覚が生まれます。
評価エラーの種類と対策は人事評価のエラー11選、中心化傾向の詳細は評価者バイアス、評価者の育て方は評価者研修の設計で扱っています。
よくある質問(FAQ)
Q. 何人分のデータがあれば分析できますか? A. 評価者1人あたり5名以上が目安です。3名以下では偶然の影響が大きく、傾向として読めません。
Q. 分析結果を評価者本人に見せてもよいですか? A. 見せてください。ただし「あなたは甘い」と伝えるのではなく、全体の分布の中で自分がどこにいるかを示す形にします。
Q. 甘辛の補正を自動で行う機能は必要ですか? A. おすすめしません。自動補正は評価者の責任感を下げます。数値は議論の材料に留め、確定は評価会議で行うのが健全です。
Q. 過去データが無い状態でも分析できますか? A. 初回の評価からでも、評価者間の比較はできます。前期との比較は2期目以降になります。
評価者ごとの甘辛分析を標準機能として持つAI人事評価システム「Scale人事評価」では、評価会議にそのまま持ち込める形で分布を出力できます。AI活用の全体像はAI人事評価とは?をご覧ください。
