.

Сделать репост в соц сети!

среда, 5 июля 2017 г.

Домашнее задание: Какие факторы влияют на вероятность проработать больше года в компании.



Привет, HRM. Я не математик или програмист. Посетил семинар Эдуарда Бабушкина по HR-аналитике. Это мое домашнее задание. 

Дата сет

Датасет предоставлен Эдуардом после семинара. 5000 ответов на вопросы анкеты. Кстати, если хотите узнать свою оценку на рынке труда в денежном эквиваленте можно пройти тест в блоге Эдуарда https://edwvb.blogspot.ru/…/01/skolko-ya-stoyu-na-rynke.html
Просто работаю с датасетом для себя отметил как можно моделировать анкету для построения модели в будущем. Теперь понимаю — ошибкой будет создать опросник или анкету в компании, без понимания на какие аналитические вопросы она отвечает. Конечно, для опытных аналитиков это очевидно, для меня открытие.

Какую задачу взял в домашнее задание?

Поставил себе задачу найти факторы, которые влияют на вероятность сотрудника проработать больше года в компании. Задача классификации. До семинара ничего сложнее регресии для красивой линии на графике я не считал. Сразу практика и в построении модели классификации и интрепретации ROCR кривой, оптимизация модели на точность.

Думаю это останется моим блоком для аналитики и в будущем. При условии, что подбор и обучение нового сотрудника стоит дороже, чем удержание уже принятого и прошедшего обучение и испытательный срок. Сейчас я провожу реструктурицазию подразделения где ошибка сотрудника в коммуникации стоит от 4 до 10 млн рублей в обороте для компании. Эту ошибку я закладыаю в стоимость обучения и прохождения адаптационного срока. 

Как решал задачу?

Первое, что хочу сказать — на ощуп. Как я был рад, что нам предоставили живой код после семинара, потому что без него, я бы остался один на один с машиной. Прошел все шаги, которые Эдуард прошел с нами за два дня на семинаре.

Препроцессинг:

— Большую часть времени обрабатывал данные и приводил их к нужному формату.
— Важно в компании сразу настраивать корректную гигиену данных
— Столкнулся с проблемами о которых говорил Эдуард на семинаре.
Взял переменные как отличие по заработной плате между обещанной и рельаной, белая или серая заработная плата?  Превратил их в факторные переменные, заодно заменил NA если их было не более 5% от общего числа самым популярным ответом. Если пропущенных значений было больше 5%, то я просто удалял их из датасета. 

Что взял за Y или выходная переменная

В итоговом варианте, взял за Y стаж сотрудника до увольнения. Опять же, помог код , он был предоставлен на семинаре. 
— Поставил дату увольнения end переменная
— Дата устройства как begin.
— Далее вычислил разницу и получил стаж.
Затем пришлось очистить данные от ошибок. Например стаж у части был минусовой. Так же убрал данные где стаж превышал 200 месяцев.

В итоговом датасете:

Тех кто уволился до 12 месяцев событие 0 = 1359 наблюдений
Тех кто уволился после 12 месяцев событие 1 = 737 наблюдений

Какие параметры включил в модель?

Некоторы парметры, например переработки личные и руководителя я прерватил в новую переменную в виде комбинации двух параметров. 
Пол = gender
Наличие наставник = mentor
Время до работы = worktrip
Белая или серя зап = salary_
Публичная критика = crit
Тип офиса workspace
Наличие интранета = intranet
Доступ к социальным сетям = social
График работы = schedule
Перерабатывал ли сотрудник и его руководитель? = overmatch
Наличие обратной связи = os
Обучение и курсы квалификации = growth
Поддержка инициативы = initiative
Наличие детей в комбинации с кредитами = kids_loan
Возраст руководителя = bossage 
Перерабатывал ли руководитель ? = bossover
Вид квартиры = flat
Премия = bonus

Результаты работы алгоритмов:

GLM без кроссвалидации 

АUC = 0.68

GLM с кроссвалидацией. 

Тот же результат что и с кроссвалидацией. 

Random forest

АUC = 0.71, при числе факторов 16

Общая точность 65% при границе отсечения 0.4

Точность полнота

Важность факторов: 

— Отсутствие премии
— Серая заработная плата
— Отсутвие интранета
— Отсутсвие инициатив со стороны сотрудника
— Наличие детей, при отсутствии кредитов.
— Пререаботки со стороны сотрудника при отсутствии переработок от руководителя
— Отсутствие заботы о росте сотрудника.


XGboost

АUC = 0.69. Тренировка модели заняла вместе с подгонкой 4 дня. Random Forest 6 часов. В итоге часть параметров по прежнему на границах значений которые я выставил в настройки. Духу сражаться дальше с настройками не хватило. Скорее всего нужно было выкидывать из модели лишний параметры и упрощать модель.

Итоговые параметры:



Сетка настроек:


Точность полнота:


Важность факторов: 


— Отсутствие премии
— Пререаботки со стороны сотрудника при отсутствии переработок от руководителя
— Серая заработная плата
— Наличие детей, при отсутствии кредитов.

— Отсутвие интранета
— Оупен спейс офис
— Обратная связь не реже одного раза в неделю.
Скорее всего параметр нужно было удалять. Вот соотношение с уволились до 12 месяцев и после.

— Rec4 = Все достижения отмечены руководителем
— Rec 2 = Изредка получал обратную связь
— Руководитель перерабатывал меньше чем сотрудник.

Что в итоге?

— Бонусы влияют на верояность сотрудника проработать дольше года.
— Модель нельзя использовать для прогноза т.к. низкая точность на текущий момент.
— Серая заработная плата и переработки сотрудника,когда руководитель не перерабатывает увеличивают риск сотрудника покинуть компанию.


Чем полезно для бизнеса?

— Проверять навыки руководителей. Могут ли они структурировать работу так, что бы сотрудники работали в комфортном режиме.
— Если нет, способен ли руководитель вместе с сотрудниками компенсировать объем работ и своими часами тоже
— Важным параметром оказался интранет и сотрудники с наличием интранета работила дольше 12 месяцев чаще чем без интранета. Здесь скорее влияние внутренних комуникаций в компании и чувства споричастности к группе. Хотя это мои догадки.

Чему научился?

— Подбирать алгоритм
— Строить модель и тестировать ее
— Работать с современными алгоритмами машинного обучения
— Понимаю как внедрить тот же процесс у себя в компании и у клиента
— По сути нужно было делать дожитие и смотреть какие факторы увеличивают риск уволиться. Но это уже был бы третий разворот модели. Мне пока не под силу физически:) 

Чему предстоит научиться?

— Применять модели в бизнес решениях
— Понять как вывести важность параметров отностельно одного из откликов Y параметра

Что предстоит сделать?

— Построить модель для прогноща срока работы сотрудника на живом примере
— Построить регрессионный анализ для предсказания способности продавца продавать на заданный уровень
— Попробовать научить модель оценивать письменные переписки сотрудников с клиентами.
Друзья, это мой текущий уровень понимание. Буду благодарен за обратную связь и критику. Сейчас важно понимать куда дальше настравивать обучение?


Конференция по hr-аналитике журнала Штат 05.07.2017



Сегодня состоялась конференция по HR-аналитике журнала Штат. Я завтра улетаю в Сибирь, поэтому пишу, чтобы успеть.
И мне бы очень хотелось, чтобы про конференцию было побольше аналитических отзывов. Я уже многажды в блоге упоминал, чем наш рынок от западного отличается (см. О качестве HR-аналитики в России (в сравнении с Западом)): в Лондоне прошла конференция по HR аналитике, после которой интернет накрыла волна постов с рефлексией того, что было на конференции, а, точнее, с тем, что происходит в HR аналитике. И это говорит о том, насколько важна конференция как буквально некая фиксация того, что происходит на рынке, в профессиональном сообществе.
Я публикую этот пост с тем, чтобы в России создать такую традицию - рассматривать конференции как некие этапы, как рефлексию происходящего. И я надеюсь, что участники конференции меня поддержат, напишут свои отзывы. Тем более, что конференция по HR аналитике журнала Штат заслуживает того, чтобы войти в истории развития HR аналитики в России.
Достаточно сказать, что слово xgboost прозвучало сегодня в трех докладах: моем, компании Deloitte и компании KPMG. И это главный признак того, что ситуация с предиктивной аналитикой меняется.
Мужчины показали модели прогноза текучести: были построены модели классификации, в одном случае с порогом работы в год, в другом в два года.
 На фото ниже представитель компании KPMG Иван, простите, не запомнил фамилию. На презентации даже можно разобрать слово XGboost.

Конференция по hr-аналитике журнала Штат 05.07.2017
Я не буду критиковать такой подход, участник семинара по R - Артем Николаев - делает, скажу по секрету, аналогичную модель, поэтому я в его посте развернусь и скажу все, что я думаю по этому поводу.
Ну и коллеги, я имею ввиду спикеров конференции - надеюсь, не обижаются. Я же критикую за ради того, чтобы модели были более красивые. Я здесь скорее в продолжение дискуссии с Иваном хочу задать ему вопрос: Иван в модели сначала получал кластеры причин увольнения, которые потом включались в модель (ну т.е. каждому сотруднику присваивался номер кластера). Кластер получается на основе нескольких источников, в т.ч. exit интервью (если я правильно понял).
Я сказал Ивану, что модель оверфитится, он возразил, что на тест данных все ок, но я то имел ввиду простую штуку: у нас модель применяется на "живых" сотрудников, тех, кто еще работает, а у Ивана в модели информация exit интервью о причине увольнения. И взять ее на "живых" работников будет просто неоткуда, ну разве что предложить работающим заполнить exit интервью. Или я что то не так понял по причине своей тупости. У меня есть такой недостаток, я очень невнимательно слушаю доклады и очень долго въезжаю.
И я бы предложил мужчинам в принципе обсудить вопрос, а правильно ли строить модели классификации по прогнозу текучести? Готов предложить дискуссию, приведу свои аргументы.
Можно еще отметить доклад Станислава Павлова - представитель консалтинговой компании, который показал, как они строили модель прогноза эффективности руководителей филиалов одного из Банков


Конференция по hr-аналитике журнала Штат 05.07.2017
По описанию было понятно, что использовали регрессию, получили R2 = 0, 3 - что близко тому, что я получал в подобных случаях, что наводит на мысль, а не потолок ли это для моделей, построенных на подобных данных? И это очень важный вопрос.
Возвращаюсь к Станиславу: я бы таки заменил часть подачи в стиле HR подачей в стиле машинг лернинг, но может это было так задумано с т.з. маркетинга.
В любом случае подобные кейсы дали возможность шикарно провести время.
Самое ВАЖНОЕ: мы, HR, наконец взяли лопату в виду XGBoost, и даже где-то копать научились, теперь на конференциях будет происходить очень интересные вещи: коллеги будут не столько икджибустом махать, а стараться находить красивые содержательные вещи, а в этом месте уже не xgboost важен, а то, куда им копать. Будет война за идеи. Это самое важное и вкусное.
Я выступал с двумя докладами: первый про тренды в Мировом HR, а во второй - показывал свою модель Сколько я стою на рынке.
Во время первого доклада произношу шуточный прогноз: следующего спикера на свою конференцию по цифрам ХХ пригласит Давида Грина, в перерыве подходит Наталья Данина и говорит, что у них уже месяца два висит эта информация. Но я то бы как раз хотел бы послушать других спикеров.
В первом докладе я рассказывал основные результаты конференции. Как бе с одной стороны меня это не красит, ибо упростил себе работу, но мою совесть успокаивает тот факт, что многие результаты мной выстраданы лично и лично мне симпатичны. Потом прошелся по мифам HR и в конце показал кейс со своего семинара, как должна выглядеть предиктивная аналитика.
Второй доклад я делал после Натальи Даниной, она про рынок говорила много вещей, я зацепился, потратил кучу времени на рассказ своих выводов по рынку, в итоге на саму модель у меня осталось очень мало времени.
Но я сделал интересную штуку: показал данные участника опроса, попросил назвать зарплату, причем участник опроса был c&b - то, что участникам конференции было совсем близко, ответы по зарплате были в диапазоне от 70 до 150 000 р. Моя машинка дала прогноз 144 000 р, а дама получала 165 000 р, поэтому в среднем машина дает более точные прогнозы. Шутка.
Ну и не рассказал про меру схожести: что каждому респонденту можно показать похожих на него спецов на рынке. Думаю, что проведу на эту тему еще один вебинар, чтобы закрыть гештальт.
В любом случае, если вы были на конференции, слушали мой доклад про сервис, приглашаю поучаствовать в исследовании, укажите свой е майл, я вам сделаю отчет. Кто о чем, а вшивый о бане
И спасибо Штату, лично Елене Беляевой, которые решаются проводить и собирают аудитории на конференцию, подобную этой. Продолжим традицию.
__________________________________________________________
На этом все, читайте нас в фейсбуке и телеграмме

Регрессия: Как начать предсказывать

Вот и я решил замахнуться ни на что-то там такое, а на самую, что ни на есть регрессию.

В предыдущих статьях мы вместе с вами уже рассматривали много интересных задач:

·   Мы выявляли различия в уровне исследуемого нами признака (когда сравнивали количество прочитанных книг теми, кто быстро и теми, кто медленно читает):

·        Мы рассчитывали оценку сдвига значений исследуемого признака (когда изучали эффективность учебного мероприятия):

·        Мы искали различия в распределении исследуемого признака (когда исследовали вопрос текучести кадрового резерва и строили Карты Шухарта):

·        Мы проводили анализ изменений признака в различных группах (когда проводили дисперсионный анализ): https://edwvb.blogspot.com/2017/04/blog-post.html

Многое мы уже вместе с вами сделали, но вот до регрессии все дело не доходило. Сегодня именно тот день! J


Об R

Выступая на различных публичных мероприятиях с темой аналитики, я всегда интересуюсь о том, какие инструменты использует бизнес для анализа. И, как бы это печально не звучало, в 99% случаев бизнес использует для этих целей Excel. И это проблема! И дело здесь не только в HR функции. И финансисты, и стратеги, и производственники, и маркетологи, и продавцы… все используют Excel.

Нет, в Excel нет ничего плохого. Просто этот инструмент не для таких задач. Для аналитики каждому бизнесу нужно научиться использовать более продвинутые и более пригодные инструменты – R, Python, Julia.

Я хочу, чтобы бизнес начал осваивать эти новые инструменты. Именно поэтому, начиная с этой статьи, я буду давать в тексте и короткие комментарии о том, как что-то сделать на языке R с использованием RStudio.

Постановка задачи

Идея данной статьи, как и всех предыдущих, учебная. Наша задача состоит в том, чтобы не просто построить регрессию, но и по пути разобраться в том, как устроен весь этот процесс. Разобраться и понять: что это такое и зачем она – регрессия – вообще нужна. Чтобы регрессия не казалась чем-то страшным и пугающим.

Для построения регрессионной модели нам нужны переменные. Одна переменная, которую мы будем предсказывать, называется Зависимой переменной (ЗП). Другая или другие (их может быть несколько) переменные, которые помогают нам предсказывать Зависимую переменную, называются Независимыми переменными (НП).

Справедливости ради стоит сказать, что вся ценность регрессионных моделей именно в их предсказательной способности. Просто так строить регрессионную модель нет никакого большого смысла. А вот построить модель сегодня, чтобы она завтра тебе уже что-то предсказывала, это другое дело.

Давайте уже начнем!

Линейная регрессия с одной независимой переменной

Мы будем работать с данными, которые получены в ходе проведения исследования по скорочтению. Каждый раз, когда я провожу очередной мастер-класс по скорочтению, я собираю все новые и новые данные.

Загрузить данные в R можно следующей командой:
dataset <- read.csv("SpeedReading_3_Groups.csv", sep = ";")

Посмотреть на первые шесть строк нашего датасета можно так: head(dataset)

Мы будем предсказывать Количество прочитанных книг (Сколько.книг). Это будет наша Зависимая переменная. А Скорость чтения (Скорость.чтения) будет Независимой переменной.

Другими словами, мы будем пытаться предсказать, сколько книг человек прочитал за год на основании его скорости чтения (слов в минуту). Для этих целей мы будем использовать простую линейную регрессию.

Начинаем, как всегда с визуализации наших данных. Давайте построим обычный scatter plot, где по Х будет наша НП, а по Y наша ЗП. Такой график поможет нам понять характер взаимосвязи между нашими переменными.

Построить scatter plot в R можно следующим кодом. Предварительно нужно не забыть загрузить библиотеку ggplot2.
library(ggplot2)
ggplot(df_post, aes(x=Скорость.чтения, y=Сколько.книг))+ geom_point(size=3)+
  ggtitle('Скорость чтения & Количество прочитанных книг за год (scatter plot)')+
  xlab('Скорость чтения, слов/мин') +
  ylab('Кол-во прочитанных книг, шт.')

Из графика мы видим, что при увеличении скорости чтения возрастает и количество прочитанных книг.

Давайте попробуем построить простую линейную регрессию с одним предиктором.

Построить простую линейную регрессию с одним предиктором можно следующей строкой кода:
fit_2 <- lm(Сколько.книг  ~ Скорость.чтения, data=dataset)
fit_2

В итоге получим следующий результат:
Давайте немного отвлечемся и вспомним университетскую программу по статистике J.

Уравнение простой линейно регрессии с одним предиктором выглядит так:

y = b0 + b1*x

Идея данного уравнения состоит в следующем. Мы хотим предсказать значение y, на основании значения xy – это количество прочитанных книг. А x – это скорость чтения.

Что же такое b0 и b1?
b0 – называется intercept, а b1 slope.

Не буду вдаваться в более глубокие пояснения, а скажу только, что наша регрессионная модель, как раз и позволяет найти эти самые b0 и b1.

Давайте еще раз взглянем на нашу модель.

Для того чтобы это сделать, достаточно просто в консоле RStudio набрать имя нашей модели: fit_2 и нажать Enter.
Мы видим, что intercept, т.е. b0=1.23343, а b1=0.02485. Следовательно, наше уравнение примет следующий вид:

y = 1.23343 + 0.02485*x

Или

Кол-во книг = 1.23343 + 0.02485*Скорость чтения

Давайте попробуем воспользоваться полученной формулой.

Средняя скорость чтения всех участников находящихся в базе составляет 238 слов в минуту. Давайте ее и подставим в формулу:

Кол-во книг = 1.23343 + 0.02485*238 = 7 книг

Т.е. получается, что человек, который читает со скоростью 238 слов в минуту, за год прочитывает около 7 книг.

Давайте посмотрим на фактические данные по Скорости чтения и Количеству прочитанных книг в нашем датасете:

Для этого достаточно просто набрать имя нашего датасета с нужными номерами столбцов:
dataset[,c(4,5)]

Мы видим, что, например, строка 15 очень близка к нашему прогнозу. Т.е. человек со скоростью чтения 250 слов в минуту прочитал за прошлый год 8 книг.

Но при этом мы также видим и другую картинку. Например, строка 8: при скорости чтения 234 слов в минуту мы видим всего лишь 3 книги. Или, интересная строка 17: при скорости чтения 149 слов в минуту мы видим 14 прочитанных книг.

Почему так происходит? Давайте взглянем на более развернутое описание нашей линейной модели с одним предиктором.

Чтобы его получить, следует выполнить следующую команду:
summary(fit_2)

Что мы здесь видим?

Мы видим наши коэффициенты b0=1.23343 и b1=0.02485 (выделено синей линией на рисунке). Также мы видим, что наш коэффициент  значим, т.е. p<0,05 (выделено красной линией на рисунке).

Но самый большой интерес в этом описании вызывает R-squared значение, которое равно 0,1425 (выделено зеленой линией на рисунке). Это означает, что наша модель объясняет только около 14% изменчивости нашей зависимой переменной (т.е. Количество прочитанных книг). А это нам говорит о том, что в модель нужно добавлять другие предикторы (независимые переменные), которые усилят (читай – позволят более точно прогнозировать зависимую переменную) нашу модель.

Именно поэтому (R2 = 0,1425) нашей модели не всегда хватало точности в прогнозе Количества прочитанных книг на основании Скорости чтения, когда мы подставляли значения в формулу и смотрели фактические значения в нашем датасете.

Давайте теперь нарисуем на нашем scatter plot линию регрессии.

Чтобы это сделать нам нужно выполнить следующий код в RStudio:
ggplot(dataset, aes(x=Скорость.чтения , y = Сколько.книг))+
 geom_point(size=3)+
 geom_line(aes(x=Скорость.чтения, y=predict(fit_2, dataset)),col="red",lwd=1)+
 ggtitle('Скорость чтения & Количество прочитанных книг за год (scatter plot)')+
 xlab('Скорость чтения, слов/мин')+
 ylab('Кол-во прочитанных книг, шт.')

На графике мы видим, что наша линия регрессии (т.е. наше уравнение) y = 1.23343 + 0.02485*x не очень точно описывает взаимосвязь. Есть много точек гораздо выше линии регрессии и также есть много точек гораздо ниже нашей линии регрессии.

Давайте теперь попросим нашу модель спрогнозировать Количество прочитанных книг для каждого участника из датасета.

Чтобы это сделать, мы можем использовать следующий код:
y_pred <- predict(fit_2, newdata = dataset)
results <- cbind(y_pred, dataset$Сколько.книг)
colnames(results) <- c("predicted", "actual")
results <- as.data.frame(results)
results

В результате выполнения данных команды, мы получим следующую таблицу:


В этой таблице мы видим фактические значения (actual) и предсказанные нашей моделью значения (predicted).

Мы можем сравнить полученные пары значений и опять увидеть, что наша модель не очень точно предсказывает Количество прочитанных книг. Мы помним, что R2 нашей модели равен 0,1425. А это очень мало для адекватной модели.

Что мы можем сделать, чтобы улучшить нашу модель? Мы можем добавить в нее другие предикторы (независимые переменные). Например, пол, возраст и т.д. В данном случае, нам нужно будет построить множественную линейную регрессию.

Также, мы можем попробовать построить полиномиальную модель, где наш предиктор Скорость чтения мы будем возводить в степень.

Но это уже идеи для будущих статей. J

Работая с простой линейной регрессией с одной независимой переменной, следует также помнить о нескольких условиях ее применения:
         1)    Линейная взаимосвязь между ЗП и НП
         2)    Нормальное распределение остатков
        3)    Очень страшное слово – гомоскедастичность, т.е. постоянная изменчивость остатков на всех уровнях независимой переменной

В этой статье мы не затронули эти условия. Но в будущих статьях, обязательно сделаем проверку, выполняются ли они.

Вывод

Важно отметить для коллег HR-ов, что на месте нашей независимой переменной и зависимой переменной могут быть абсолютно другие данные, которые у вас имеются и которые вы хотели бы предсказывать. Например, уровень заработной платы и эффективность сотрудника, оценка компетенций и результативность, выполнение плана продаж и уровень управленческого потенциала и т.д.

Итак, в данной статье мы:
       1)    рассмотрели, что такое регрессия и для чего она нужна
  2) построили график scatter plot, который отображает взаимосвязь двух переменных
       3)    построили регрессионную модель с одним предиктором
     4)  сделали прогноз нашей зависимой переменной, используя полученную модель, и сравнили наши фактические данные с предсказанными значениями
      5)    наметили, куда двигаться дальше J

понедельник, 3 июля 2017 г.

Как diversity влияет на результативность команды

Это пост - обращение за помощью к вам, коллеги. Мне нужны руки. Скорее это вопрос к преподавателям ВУЗов, у кого есть рабочие руки в виде студентов. Но помимо работы руками Ваши студенты могли бы сделать хороший курсовой проект, аналогов которому в России нет.
Все дело в diversity. В Google diversity это официальная политика компании, см. Блог компании Google и политики diversity - там зарезервирован определенный % (кажется, 20) за женщинами разработчиками, считается, что они вносят разнообразие в коллективы мужчин, позволяют командам работать результативнее.
В Apple появился вице-президент по многообразию и меньшинствам - целый вице презик по вопросам diversity.
Давид Грин по результатам конференции HR аналитики в Лондоне 20-21 апреля пишет, что тема diversity ключевая.
Но самое прикольное, что я не видел ни одного нормального западного исследования на тему влияния diversity на результативность команды. Ну кроме может быть Что делает команду более умной? Больше женщин. Но в этом исследовании есть одна загвоздка: эти исследования лабораторные, и задачки там искусственные, не бизнесовые. А нам нужна жизнь.
А мы, российские HR, сидим на попе и даже рассуждаем на эту тему едва едва.... И не рассуждаем вовсе, а жуем западные слухи.
Я хочу перейти к действиям.

Идея

В России есть совершенно потрясающая возможность провести полевое исследование на тему diversity - это игра ЧТО ГДЕ КОГДА
У нас есть все компоненты для того, чтобы сварить солянку:
  1. результат игры - настоящий, не лабораторный;
  2. команда - шесть интеллектуалов;
  3. история - данных накоплено уже не мало;
  4. diversity - разнообразие. Команду можно представить в виде разностей возрастов, пола, жизненного опыта и т.п.. 

Что я жду в качестве помощи?

На сайте игры ЧтоГдеКогда собрана статистика игр за все годы. Мне нужны руки, которые бы помогли собрать данные с этого сайта.
Часть информации я сам скачаю непосредственно с сайта, но там нет информации про год рождения игрока.
Эту информацию надо раздобыть. Несколько сотен игроков, как мне кажется.
Кроме того, нужно будет провести мозговой штурм про метрики diversity - что собственно выбрать в качестве переменной влияния. Стандартное отклонение возраста команды? Не уверен. Нужно будет подумать над этим.
Итого, нас может ждать очень вкусные результаты. Пишите, если вам интересно edvb()yandex.ru

суббота, 1 июля 2017 г.

Бренд компании и непосредственный руководитель


Ту статистику, что я показываю, легко собирать в компании. Через exit интервью, например.
Я эту статистику собираю через исследование, в котором участвует в лучшем случае 5 % тех, кто просматривает этот пост, хотя ссылка дана именно для того, чтобы поучаствовали.
У нас в исследовании есть вопрос о Бренде компании "Готовы ли Вы рекомендовать эту компанию в качестве работодателя своим знакомым, коллегам?":

  • Да
  • Нет
  • Не знаю

И вопросы об отношениях с непосредственном руководителе. Буду последовательно показывать связь бренда компании с отношениями с руководителем. 

Как часто Ваш руководитель давал (дает) Вам обратную связь

Самый стандартный вопрос
Бренд компании и непосредственный руководитель
Да, Нет и Не знаю - это про готовность рекомендовать, а каждый столбец - это про частоту обратной связи с руководителем. 
Хи квадрат 0.0005

Благодарил ли Вас Ваш руководитель за достижения?

Ласковое слово и Бренду приятно
Бренд компании и непосредственный руководитель
Хи квадрат просто неприличный 4.96349730035469E-12

Проявлял (проявляет) ли Ваш руководитель заботу о Вашем развитии?

Бренд компании и непосредственный руководитель
Хи квадрат все неприличней 1.32006673598833E-14
Прогнозный модель сама в рот просится: у нас только 6 % будут не рекомендовать, если руководитель тебя на курсы посылает.
Но тут есть одна фишка, про которую нужно понимать: это надо еще со стажем соотносить. Мозги прочищает. 

Выходили (выходите) ли Вы со своими инициативами на руководителя

Бренд компании и непосредственный руководитель
Кто бы сомневался, что сторонники Путина третья группа самые счастливые люди на планете. 
Прислали тут описание вакансии hr аналитика: молодой, не амбициозный. Овощ, короче. Где они собрались такого идиота искать, ума не приложу.
Хи квадрат здесь с неба не хватает, но вполне себе приличный 0.00019

Резюме

Так может быть вместо конкурсов по бренду, попробовать сделать что-то реально полезное для компании, измерив уровень отношений с руководителем, поняв, как это связано с брендом компании, и попробовать управлять этим через развитие руководителей? Это сложнее, чем всякие программульки развивать типа agile. Здесь проблема в том, что ваши действия измеримы. Если, например, уровень отношений с руководителем не изменился за год, а вы вбухали 1, 5 мил баксов в их развитие, то вам ведь бизнес может задать вопрос, верно?
Но если вы таки хотите такую аналитику наладить в компании, обращайтесь
Либо записывайтесь на семинаре, где я Вас буду учить самих это делать Семинар - практикум "Аналитика для HR", 19-20 октября 2017 г., г Москва

Понравился пост? 

и Вы захотите выразить мне благодарность, просто покликайте на директ рекламу ниже на странице - у вас это отнимет несколько секунд, а мне принесет немного денег. Или поучаствуйте в исследовании в знак благодарности.
На этом все, читайте нас в фейсбуке