.

Сделать репост в соц сети!

суббота, 10 января 2015 г.

Лояльность работодателю определяется стажем

В исследовании Ключевые факторы удержания и текучести персонала (опрос открыт и ждет вашего участия) был такой вопрос о лояльности бывшему работодателю
Если бы вы остались без работы, как бы вы восприняли предложение бывшего работодателя о работе
  • Принял(-а) бы предложение (на диаграмме обозначено как “yes”)
  • Рассмотрел(-а) бы среди прочих (“among”)
  • Пошел (пошла) бы работать в случае крайней нужды (“need”)
  • Не стал(-а) бы рассматривать в принципе (“no”)

Описательные статистики такие
$among
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
   1.00   15.00   29.00   38.15   51.00  189.00

$need
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
   1.00   12.00   23.00   33.49   42.00  189.00

$no
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
   1.00    9.00   18.00   28.91   36.00  193.00

$yes
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
   2.00   15.00   33.00   43.08   54.50  183.00

Call:
lm(formula = log(r1$stag, base = exp(1)) ~ k, data = r1)

Residuals:
    Min      1Q  Median      3Q     Max
-3.2679 -0.6289  0.0646  0.6943  2.4044

Coefficients:
            Estimate Std. Error t value Pr(>|t|)   
(Intercept)  2.85829    0.03750  76.227  < 2e-16 ***
kamong       0.40963    0.05372   7.625 3.69e-14 ***
kneed        0.21262    0.05726   3.713  0.00021 ***
kyes         0.50786    0.07769   6.537 7.85e-11 ***
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Residual standard error: 0.9907 on 2093 degrees of freedom
  (23 observations deleted due to missingness)
Multiple R-squared:  0.03514,  Adjusted R-squared:  0.03376
F-statistic: 25.41 on 3 and 2093 DF,  p-value: 3.828e-16

Различия значимые: контрольной группой взял тех, кто не стал бы рассматривать в принципе.
  • «Средний срок жизни» самых нелояльных – 17 месяцев
  • Тех, кто вернулся бы в компанию по необходимости – 21, 5 месяца
  • Тех, кто рассмотрел бы предложение бывшего работодателя – 26 месяцев
  • Тех, кто вернулся бы однозначно – почти 29 месяцев
Диаграмма. Связь лояльности и стажа
По оси X - стаж в месяцах, ось Y - показатели лояльности
Для тех, кто не знает, как читать данный тип диаграмм Как читать диаграмму boxplot.

Лояльность работодателю определяется стажем

Вывод: чем дольше работает в компании работник, тем бОльшая вероятность, что после увольнения из компании он будет ей лоялен

Аналитика для HR-директора. Мастер – класс

Анонс нового семинара. Текст анонс тестовый. Буду благодарен за критику, вопросы

Аналитика для HR-директора. Мастер – класс

HR аналитика больше, чем hr-метрики, бенчмаркинг, ROI, модель Киркпатрика и даже больше, чем применение статистических методов анализа данных, а представляет из себя тип мышления менеджера, способ управления. На семинаре я хочу донести основы это до участников.
Семинар является продолжением семинара Аналитика для HR, но если Аналитика для HR – для тех, кто будет считать – это «лопата» и «грабли», то Аналитика для HR директора для тех, кто сам не считает в excel, а является потребителем результатов анализа: ставит задачи, делает выводы, интерпретирует результаты, представляет варианты, принимает решения.

Формат

Лекция + разбор кейсов + работа в группах по решение кейсов два дня по 8 академических часов (с 10.00 до 18.00). 

Область результатов

Знания и навыки:
  • технологии выстраивания процессов управления на основе данных в компании (от сбора данных до принятия решения);
  • базовых терминов статистики (корреляция, регрессия, объясненная дисперсия, доверительные интервалы и т.п..);
  • чтения  аналитических отчетов (зарплатные обзоры, бечмарки);
  • постановки задачи аналитику (в том числе внешнему провайдеру);
  • принципов создания и проведения корпоративных опросов;
  • принципов «оцифровки» данных (и сюда же знание принципов «датификации»);
  • принципов принятия решения на основе данных;
  • основных приемов визуализации под разные типы решений;
  • постановки задачи ай-ти отделу на автоматизацию сбора данных.

Условия участия

Просмотр фильма «Человек, который изменил все». Опционально (по желанию): 

Спикер

Бабушкин Эдуард

Содержание семинара

  • Эволюция аналитики: что привнес в HR Moneyball
  • Какие задачи решает HR-аналитика
  • Как ставить задачу (или: как переводить с языка бизнеса на язык аналитики)
  • Основы моделирования управления процессом на основе данных (например, управления эффективностью и текучестью персонала на основе данных).
  • Методология аналитических методов
    • Чем гипотеза отличается от мнения;
    • Что такое факторы / драйверы процессов;
    • Чем корреляция отличается от причинно-следственной связи;
    • Основные показатели силы взаимосвязи: корреляция, регрессия – и что это нам дает;
    • «Очищение» эффекта влияния факторов;
  • Принятие решения на основе данных: понятие рисков, вероятностей при принятии решения
  • Визуализация: основные принципы решений

Как реализовать в компании

  • Сбор данных
    • Сбор данных как процесс, а не проект;
    • Какие данные собирать;
    • что такое «оцифровка» данных, что такое «датификация»;
    • отчет как элемент системы сбора данных: элементы отчета;
    • как выстроить систему отчетов;
    • автоматизация сбора данных.
  • Структура баз данных: «матрица».
  • Команда проекта
    • как объяснить айти отделу, что вы хотите получить;
    • как подобрать аналитика: какими скилсами он должен обладать.
  • Лирика: культура данных в компании

Кейсы мастерской (состав может меняться)

  • Исследование вовлеченности;
  • Создание корпоративного опроса;
  • Чтение зарплатных обзоров;
  • Использование тестов и личностных опросников («психологических тестов») в отборе персонала;
  • Связь между оценкой по компетенциями и KPI;
  • Оценка эффективности обучения;
  • Влияние каналов привлечения (источников трафика) кандидатов на текучесть персонала ;
  • Влияние отношений с руководителем на текучесть персонала;
  • Разрабатываем анкету рекрутера, exit – интервью, опросник.
  • Принимаются к анализу кейсы участников.

четверг, 8 января 2015 г.

Что читали HR в 2014 году



В конце прошлого года собрал отзывы: что читали в 2014 году. При этом имелось ввиду. что литература могла быть как профессиональная, так и художественная. Главное условие - оказала влияние на профессиональное развитие.
Я не представляю как можно систематизировать книги, поэтому выкладываю просто все, что написали. Замечу только, что в топе чтения Большие данные, В. Майер - Шенбергер.
И само обсуждение не закрыто, можно оставить отзыв здесь Топ книг 2014
Итак

среда, 7 января 2015 г.

Поколения X и Y: кто чаще меняет работу



Я уже не аноснирую наше исследование в начале, пишу так много, что не ожидаю незнакомых людей в нем, но если и появятся, ссылка на исследование текучести внизу, проголосуйте - оно по прежнему актуально.
Если вся эта аналитическая фигня неинтересна - читайте внизу вывод жирным 
Логика проверки заключается, в первую очередь , в очищении эффекта корреляции пары «возраст – стаж».
Представьте ситуацию, что представитель поколения X устроился на работу в 1985 году и работает по сю пору. Это здорово, но это не значит, что поколение X более стабильно: просто представитель поколения Y в 1985 году в лучшем случае сидел на горшке и сравнивать поколения в данном разрезе некорректно.
Поэтом у справедливо было бы посмотреть ситуацию, в которой оба поколения X и Y дееспособны.
Я взял следующие границы поколений:
Поколение X = 1963 : 1981
Поколение Y = 1982 : 1992
Верхнюю границу поколения Y я не стал поднимать до 1995 года, потому что:
Я решил взять выборку респондентов, трудоустроившихся после после 1 января 2012 года. В этом году даже самым молодым представителям поколения Y уже 19 лет, они вполне трудоспособны.
Далее мы посмотрим значимость различий в стаже между поколениями X и Y.
Всего в этот период устроилось на работу 637 респондентов, из них
X   Y
227 410


Call:
lm(formula = log(r1$stag, base = exp(1)) ~ XYZ, data = r1)

Residuals:
    Min      1Q  Median      3Q     Max
-2.2638 -0.4720  0.1341  0.5165  1.2741

Coefficients:
            Estimate Std. Error t value Pr(>|t|)   
(Intercept)  2.19159    0.04842  45.264   <2e-16 o:p="">
XYZY         0.07218    0.06035   1.196    0.232   
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Residual standard error: 0.7295 on 635 degrees of freedom
Multiple R-squared:  0.002248, Adjusted R-squared:  0.0006766
F-statistic: 1.431 on 1 and 635 DF,  p-value: 0.2321
 Либо банальный Манн Уитни
> wilcox.test(stag ~ XYZ, data=r1, paired = FALSE)

        Wilcoxon rank sum test with continuity correction

data:  stag by XYZ
W = 43647.5, p-value = 0.1938
alternative hypothesis: true location shift is not equal to 0
Для тех, кто не знает, как читать данный тип диаграмм Как читать диаграмму boxplot.
Поколения X и Y: кто чаще меняет работу

$X
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
   1.00    5.00    9.00   10.09   14.75   26.00

$Y
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
   1.00    6.00   11.00   11.66   16.00   32.00
Вывод: мы не наши различий стаже Y-ов и X-ов.
У данного метода есть несколько недостатков, главный, на моя взгляд, в том, что я не беру в анализ незаконченные случаи, т.е. те ситуации, когда человек устроился на работу в указанный промежуток времени (после 1 января 2012 года), но еще не уволился. Эти ситуации также можно анализировать, но данная информация изначально искажена в нашем исследовании, поэтому я не могу полноценно ее включить.
Как мы можем сделать проверку? У нас в этот же промежуток времени 54 респондента указали пустой дату увольнений, т.е. они продолжали работать на момент заполнения опросника.
16  из них относятся к поколению X
38 – к поколению Y
Напомню, что ранее я давал цифры
X   Y
227 410
Это те, кто указал дату увольнения, т.е. закончил работать
Далее составляем таблицу сопряженности

поколение X
поколение Y
продолжает работать
16
38
уволился
227
410

Хиквадрат = 0, 374 без поправки на непрерывность. С поправкой – еще выше будет.

Вывод: мы не смогли доказать утверждение,что представители поколения Y чаще меняют работу, чем поколение X.
Для продвинутых аналитиков скажу, почему не сделал анализ типа Каплан Майер: у нас опрос более года длился, а дату заполнения анкеты не фиксировал, поэтому анализ дожития был бы некорректным.
Но я исправился, и в новой анкете учтены недостатки, а вы сейчас пойдете и поучаствуете в опросе Ключевые факторы удержания и текучести персонала

Пользователи какого браузера склонны быстрее увольняться

Был у нас в исследовании вопрос, каким браузером предпочитаете пользоваться. Результаты нельзя считать корректными, поскольку мы спрашиваем про браузер сейчас, а увольнялись они «тогда», то есть у нас не связана хронология, но тем не менее, если предположить, что за браузером стоят какие то личностные черты, то картина следующая
Explorer  Firefox GoogleCh    Opera   Safari   Yandex 
     183      344     1050      194       43      313 
Это описательная статистика, сколько респондентов пользовались тем или иным браузером.
И вот результат
Call:
lm(formula = log(r1$stag, base = exp(1)) ~ brauzer, data = r1)
 
Residuals:
    Min      1Q  Median      3Q     Max 
-3.3139 -0.6449  0.0877  0.6978  2.9734 
 
Coefficients:
                Estimate Std. Error t value Pr(>|t|)    
(Intercept)      3.29630    0.07669  42.979  < 2e-16 ***
brauzerFirefox  -0.12292    0.09493  -1.295  0.19552    
brauzerGoogleCh -0.25354    0.08311  -3.051  0.00231 ** 
brauzerOpera    -0.28598    0.10691  -2.675  0.00753 ** 
brauzerSafari   -0.08815    0.17583  -0.501  0.61618    
brauzerYandex    0.01755    0.09655   0.182  0.85577    
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
 
Residual standard error: 1.038 on 2121 degrees of freedom
  (25 observations deleted due to missingness)
Multiple R-squared:  0.01181,  Adjusted R-squared:  0.009481 
F-statistic:  5.07 on 5 and 2121 DF,  p-value: 0.0001265


Картинка более красивая
Пользователи какого браузера склонны быстрее увольняться

По оси Х стаж в полугодиях (т.е. 2 – один год, 4 – 2 года). Линия обозначает плотность стажа. Т.е. у большинства пользователей браузеров увольнение произошло при стаже менее года, но максимум увольнений.
Круто?
К сожалению, этот результат является той самой ложной корреляцией. Кто у нас пользуется IE? Более взрослые, кто пользуется Google CH? Более молодые. Понятно, что стаж и возраст коррелируют между собой: чем больше человеку лет, тем больше вероятность, что у него больше стаж.
Но если мы возьмем группу людей, устроившихся в один год (например, в 2012 устроилось 386 респондентов). Так вот взаимосвязь между браузером и стажем работы на уровне 0, 526.
Или если мы возьмум только людей 1981 и 1982 года рождения, то взаимосвязь будет незначима.
Отсюда вывод: при всей красивости картинки, браузер мы не можем использовать для прогноза текучести L

вторник, 6 января 2015 г.

Влияние гендера руководителя на удержание персонала

В продолжение подведения результатов опроса Ключевые факторы удержания и текучести персонала (опрос действует и ждет ваши голоса)
Пол подчиненного никак не связан со стажем. Пол руководителя по всем данным значим на уровне 0, 0007. И, конечно, у мужчин руководителей подчиненные работают дольше.
Поскольку гендер руководителя может влиять на текучесть не самостоятельно, а через другие факторы (ну, допустим, в промышленности чаще руководителем мужчина, а текучесть определяется другим фактором), то мы могли получить ложную корреляцию.
Чтобы предотвратить ложные корреляции, я взял только  HR-ов, предполагаю, что бизнес процессы HR стандартны во всех отраслях.
Значение стажа работников с руководителем мужчиной и руководителем женщиной значимо на уровне 0, 09
Кроме того, выявлено влияние отрасли (IT, HoReCa, строительство) в сочетании с гендером.
Описательные статистики для группы HR с руководителем мужчиной и женщиной
$F Женщины
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
   1.00    9.00   17.00   21.95   27.50   90.00 
 
$M Мужчины
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
    1.0    11.0    19.5    28.3    35.0   137.0 

Влияние гендера руководителя на удержание персонала

Не обнаружено значимых различий и по группе продажников.

Поэтому на сегодня нельзя считать доказанным влияние гендера на текучесть персонала. Смотреть различия в стаже по одной отрасли и одной позиции у нас нет возможности по причине малого количества подобных выборок. 

Влияние отношений с руководителем на текучесть персонала

В продолжение подведения результатов опроса Ключевые факторы удержания и текучести персонала (опрос действует и ждет ваши голоса)
У нас было несколько вопросов, характеризующих отношения с руководителем:
  1. Насколько широко Ваш руководитель делегировал Вам полномочия при выполнении работы?
  2. Критиковал ли Вас руководитель в присутствии других?
  3. Благодарил ли Вас Ваш руководитель за достижения?
  4. Общались ли Вы со своим руководителем на нерабочие вопросы?
  5. Проявлял ли Ваш руководитель заботу о Вашем развитии?

Переменные категориальные.
Я решил измерить «чистое» влияние отношений с руководителем на текучесть. Для этого выделил группу тех респондентов, кто указал, что все время работы в компании был один руководитель (428 респондентов).
Построил регрессионное уравнение с зависимой переменной стаж и вышеуказанными факторами  отношений с руководителем.
Вот результат
lm(formula = log(r1$stag, base = exp(1)) ~ zabota_razv + out_work_talking +
    kritika + delegirovanie + recognition, data = r1)

Residuals:
     Min       1Q   Median       3Q      Max
-2.71343 -0.68629  0.05499  0.67302  3.00229

Coefficients:
                    Estimate Std. Error t value Pr(>|t|)  
(Intercept)           2.0074     0.2174   9.234  < 2e-16 ***
zabota_razvsupport    0.3037     0.1200   2.530  0.01179 *
zabota_razvyes        0.3728     0.1750   2.130  0.03377 *
out_work_talkingno   -0.2514     0.1274  -1.974  0.04910 *
out_work_talkingyes   0.2109     0.1399   1.507  0.13248  
kritikano             0.3770     0.1336   2.823  0.00500 **
kritikayes            0.2846     0.1419   2.005  0.04560 *
delegirovaniefree     0.3945     0.1425   2.769  0.00588 **
delegirovaniesoso     0.1912     0.1272   1.503  0.13350  
recognitionless       0.3239     0.1679   1.928  0.05449 .
recognitionmore       0.2343     0.1701   1.377  0.16928  
recognitionno         0.1015     0.1819   0.558  0.57725  
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Residual standard error: 0.9992 on 404 degrees of freedom
  (12 observations deleted due to missingness)
Multiple R-squared:  0.1358,   Adjusted R-squared:  0.1123
F-statistic: 5.773 on 11 and 404 DF,  p-value: 1.087e-08


Предлагаю не пугаться тем, кто не знаком с выводами. Главный показатель – R squared или R квадрат. Он равен 0, 1123 при максимально возможном 1, 0.
При этом стоит добавить еще ложку дегтя: часть факторов нельзя отнести к предикторам, но только к корреляции. Например, вопрос «Общались ли Вы со своим руководителем на нерабочие вопросы» не обязательно должен быть причиной увольнения / удержания, а следствием. Т.е. не работник увольняется, потому что руководитель не общается на не рабочие темы, а за долгое время работы вместе работник и руководитель так или иначе, но имеют больше шансом пообщаться о чем то, не относящемся к работе.

И есть еще одна штука интересная: на разных этапах совместной жизни в компании одни и те же действия руководителя имеют разный эффект, разный вес влияния. И это я покажу в следующих постах

Как переработки влияют на текучесть персонала

В исследовании Ключевые факторы удержания и текучести персонала (опрос открыт и ждет вашего участия) был такой вопрос
Задерживались ли вы на работе?

  • Никогда
  • Каждый день
  • Несколько раз в неделю
  • Несколько раз в месяц
  • Не могу сказать точно
  • При моем графике невозможно говорить о задержках

Результат оказался неожиданным:

Как переработки влияют на текучесть персонала

Значимые различия в стаже выявлены между двумя вариантами вопроса:

  1. задерживался каждый день
  2. никогда


понедельник, 5 января 2015 г.

Какая выборка достаточна для исследований

В предыдущем посте Контроль рабочего времени и удержаниеперсонала мы получили следующий результат.
Есть значимые различия в стаже между теми, кто имел свободный график и работниками с жестким контролем рабочего времени.
Т.е. те, кто имеют свободный график, работают дольше. Классно?
Не совсем. Коллега обратил внимание, что у нас количество респондентов HR, имеющих свободный график работы, всего 36. И сказал, что выборка из 36 человек недостаточна для того, чтобы делать вывод. Этот аргумент часто приводят против моих исследований.
И я решил сделать пост, который бы разъяснял, сколько респондентов достаточно для принятия решения.

 Какая выборка достаточна для исследований

Помните исследования Геллапа во время выборов президента США в 30-е годы? Они провели опрос нескольких сотен респондентов. Представьте, сколько выборщиков могло быть в США в то время? Допустим 30 миллионов. 1 % от 30 миллионов – 30 000. Т.е. выборка Гэлаппа составляла в лучшем случае десятые доли % от генеральной совокупности. И тем не менее прогноз был точен.

Контроль рабочего времени и удержание персонала

В исследовании Ключевые факторы удержания и текучести персонала (опрос открыт и ждет вашего участия) был такой вопрос
Какой график работы у Вас был
  • ·         Установлено время начала и конца дня с жестким контролем
  • ·         Установлено время начала и конца дня, но контроля не было
  • ·         Свободный график
  • ·         Я работал дома

Есть значимые различия в стаже между теми, кто имел свободный график и работниками с жестким контролем рабочего времени.
«Свободные» работают в компаниях в среднем на 5 месяцев дольше, чем «несвободные».
$free_time
   Min. 1st QuMedian    Mean 3rd Qu.    Max.
   2.00   12.50   26.00   40.67   49.50  242.00

$hard_time
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
   1.00   10.00   21.00   35.14   42.00  368.00


Контроль рабочего времени и удержание персонала

Для тех, кто не знает, как читать данный тип диаграмм Как читать диаграмму boxplot.
Чтобы избежать смещения из за влияния из – за позиции (представим ситуацию: работники банков изначально должны иметь жесткий график, и текучесть может определяться не графиком, а другим фактором), я сделал сравнение только по HR

36 HR  респондентов указали, что работают в свободном графике, 550 имеют жесткий контроль времени.
Результаты совпадают с общими (что неудивительно, поскольку у нас аудитория HR – более 50 % респондентов): HR-ы на свободном графике работают в компании значимо дольше.
Контроль рабочего времени и удержание персонала

Как на текучесть персонала влияет дорога от дома до работы

Если вы читали аналогичные западные исследования Ключевые факторы удержания и текучести персонала, то обратили внимание на картинку


 Шаговая доступность работы от дома увеличивает удержание на 58 % - это результаты компании Evolv






У нас в опросе (он работает и ждет вас Ключевые факторы удержания и текучести персонала) было два вопроса о дороге между домом и работой: 1) сколько времени занимает дорога и 2) как вы добираетесь до работы.
Мы не получили значимых связей между временем в пути и текучестью персонала.
Различие в текучести стажа между теми, кто живет в шаговой доступности и ездит на транспорте, на уровне 0, 08 и не может считать достаточной для принятия. Я посчитал, что главным фактором, который вносит смещение в результаты (у меня была гипотеза, что чем меньше город, тем меньшее значение имеет шаговая доступность).
В качестве результата могу представить следующее
Как на текучесть персонала влияет дорога от дома до работы


  • Транспорт – работники, которые добирались транспортом
  • Шагом – шаговая доступность
В ячейках количество работников. т.е., например, из Москвы и Санкт - Петербурга приняло участие в опросе 41 респондент, которые пешком ходили на работу

Диаграмма распределения стажа

По оси Y – масштаб города и способ пути от дома до работы. 1 – шаговая доступность, 0 – транспорт. Ось X - стаж в месяцах (если впервые встречаетесь с диаграммой такого типа, читаем пост Как читать диаграмму boxplot)
Как на текучесть персонала влияет дорога от дома до работы

Заметно, что в городах – миллионниках и населенных пунктах с населением меньше 100 000 населения стаж работы кандидатов зримо выше. И различия статистически значимы.
А вот в городах с населением от 500 000 до 1 000 000 (два нижних ящика) связь обратная: те, кто добираются транспортом, работают значимо дольше. Я логики не вижу в результатах.

Резюме: на наших данных мы не можем подтвердить вывод исследований компании Evolv том, что шаговая доступность значимо влияет на удержание работников в компании

воскресенье, 4 января 2015 г.

Как читать диаграмму boxplot


Пост простой, но важный для тех, кто первый раз встречается с диаграммой boxplot
Представьте, что Вам встречается такая информация
$`0`
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
   1.00   11.00   24.00   35.73   45.00  410.00

$`1`
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.

   1.00   13.00   27.00   45.57   60.00  410.00 
И поясняющая диаграмма
Как читать диаграмму boxplot
1 (нижний ус) на диаграмме обозначает минимальное значение - Min/
2 (основание бочки) обозначает 1st Qu. или он же 1-й квартиль.
3 (жирная линия) - Median или медиана
4 (крышка бочки) - 3rd Qu. или 3-й квартиль
5 (верхний ус) - Max. или максимальное значение
точки обозначают выбросы
средне арифметическое - на диаграмме не показывается.
Диаграмма boxplot предназначена для показа распределения переменной и / или сравнения распределений групп

Как влияет масштаб населенного пункта на текучесть персонала

Продолжаю показывать итоги исследования Ключевые факторы текучести и удержания персонала - надеюсь, вы пройдете по ссылке и поучаствуете в опросе, даже если вы уже участвовали, поскольку я провел ре дизайн исследования.
........
Посмотрим влияние  масштаба населенного пункта на текучесть (в строгом смысле влияет не масштаб и не влияет, но не суть). В качестве контрольной группы взял города с населением от 100 000 до 500 000 населения (именно в этих городах максимальная продолжительность стажа - см. ниже диаграмму). 
И получилась забавная вещь забавная вещь: Москвичи и жители Санкт Петербурга в среднем увольняются чаще в 1,2 раза в сравнении с контрольной группой (от 100 до 500 тысяч), жители миллионников увольняются в 1,33 раза чаще, и жители городов с населением от 500 000 до 1 000 000 населения увольняются в 1, 39 раза чаще, чем контрольная группа. Различия значимы на уровне менее 0, 01.
Количество респондентов
Москва и Санкт-Петербург
970
более 1 000 000 человек населения
927
от 500 000 до 1 000 000
243
от 100 000 до 500 000
215
менее 100 000
110

Описательные статистики
lowbill – города с населением от 500 000 до 1 000 000
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
   1.00   11.00   22.00   34.03   41.00  215.00
lowhalfbill – от 100 000 до 1 000 000
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
   1.00   13.00   27.00   46.48   52.00  232.00
lowonehun – города с населением меньше 100 000
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
   2.00   12.00   24.00   37.24   50.25  209.00
Mos_Pit – Москва и Санкт - Петербург
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
   1.00   13.00   27.00   36.09   48.00  211.00
Overbill – города миллионники
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max.
   1.00   11.00   22.00   34.94   45.50  232.00
Обозначения: Min. – минимальное, 1st Qu. – 1-й квартиль, Median - медиана, Mean – среднее, 3rd Qu. – третий квартиль, Max. –максимальное значение
Если не понимаете диаграмму, читайте пост как прочитать boxplot
Как влияет масштаб населенного пункта на текучесть персонала
В строгом смысле мы не можем эти результаты переносить на всю Россию - слишком много неконтролируемых факторов, которые могут повлиять на смещение: отрасли, позиции, тип города - все это, неравномерно представленное в выборке респондентов, влияет на результаты. В данной ситуации мы можем учесть только влияние некоторых факторов, чем я в дальнейшем и займусь.