.

Сделать репост в соц сети!

воскресенье, 6 ноября 2016 г.

Аудитория джоб сайтов, или через источник трафика стоит искать работу лично вам



И снова к результатам нашего исследования факторов текучести персонала. В нашем исследовании был вопрос про источник, через который респондент нашел работу. Раньше я смотрел с позиции работодателя, какие плюсы несет тот или иной источник трафика, сейчас я показываю, как можно подойти к решению двух задач:
  1. Джоб сайты предлагают обзоры заработных плат для компаний на основе публикуемых вакансий и резюме, и я хочу показать, что аудитория джоб сайтов не описывает всю генеральную совокупность рынка зарплат, а через наше исследование можно показать отклонение;
  2. Этот пост может стать идеей для сервиса по рекомендациям кандидатам, как им искать работу.

Задача

Я хочу решить следующую задачу: на основе данных о кандидате предсказать, через какой источник трафика он найдет работу. Понимая, какой фактор влияет на выбор того или иного источника трафика, мы поймем аудиторию каждого источника трафика.

Источники трафика

В нашем исследовании много вариантов ответа на вопрос об источниках трафика, я взял только самые характерные:
  1. "Вы откликнулись на вакансию на джоб сайте" и 'Работодатель вышел на Вас через Ваше резюме на джоб сайте" я обозначил как группу "0", или "Jobsite", всего таких респондентов 929;
  2. "Вы обратились непосредственно в саму компанию по рекомендации вашего знакомого - работника данной компании" как группа '1' или "Реферал" - 212 респондентов;  
  3. "Кадровое агентство вывело вас на работодателя" - группа '2' или "КА" и 130 респондентов;
  4. "Работодатель вышел на Вас по рекомендации человека, знающего вас" - '3' или "Знакомый" - 357 респондентов.
Итого 1628 респондентов. В % отношении выборка выглядит так
Аудитория джоб сайтов, или через источник трафика стоит искать работу лично вам


Факторы

В уравнение я взял следующие факторы:
  • 'Стартовая зарплата',
  • 'Возраст при приеме на работу',
  • 'В какой социальной сети вы проявляете максимальную активность',
  • 'Ваш пол',
  • 'Знание иностранного языка на момент трудоустройства',
  • 'Какой основной браузер установлен на вашем личном ноутбуке / компьютере',
  • 'Масштаб населенного пункта',
  • 'Образование на момент трудоустройства',
  • 'Размер компании (число работников)',
  • 'Регион',
  • 'Сведения о компании. Отрасль',
  • 'Сфера Вашей деятельности',
  • 'Уровень Вашей позиции'

Результаты

Теперь немного для профи инфо. О точности модели

ROC кривая

Аудитория джоб сайтов, или через источник трафика стоит искать работу лично вам


Обратите внимание, лучше всего прогноз для группы 2, а группа 2 у нас кадровые агенства, т.е. по данным о кандидате проще всего предсказать, найдет он работу через кадровое агентство или нет.

Precision-recall curve

Аудитория джоб сайтов, или через источник трафика стоит искать работу лично вам
Скажем прямо: а никто и не обещал идеального попадания.

Важность факторов

Дальше будет жесткая картинка.
Аудитория джоб сайтов, или через источник трафика стоит искать работу лично вам
Длина столбика обозначает важность фактора, на первом месте Зарплата, на втором - возраст.
Дальше я покажу различия аудиторий по зарплате и возрасту

Зарплата

Аудитория джоб сайтов, или через источник трафика стоит искать работу лично вам

Возраст

Аудитория джоб сайтов, или через источник трафика стоит искать работу лично вам
Обратите внимание, Джоб сайты - самый молодой источник трафика, через него чаще находят работу более молодые кандидаты с медианой в 28 лет, рефералы старше джлб сайтовцев, но (!) они чуть ниже с т.з. зарплаты. А кадровые агенства дают самый большой разброс по зарплате (так что не надо говорить, что кадровые агентства только для богатых), но самая тесная группа по возрасту.
Айтишники: как вам идея стартапа - предсказывать источник трафика кандидата? Кандидат вводит свои данные, а ему в ответ рекомендации, как искать работу?
Пишите! И участвуйте в исследовании




Психологические портрет HR: чем HR отличается от других профессий


Еще одна бомба, которая не взорвется) Психологический портрет HR есть, как бы это нас не удивляло: HR -ы отличаются от других профессий
Я бы этим постом хотел обратиться, скорее, к профи, чтобы показать возможности профориентации. Чтобы показать, как BigData можно использовать в профориентации: прогнозировать, какая профессия будет лучше подходить человеку.
Только не надо умничать недопрофессионалам: я не предлагаю копировать дизайн данного конкретного исследования на работу по профориентации, в профориентации дизайн будет существенно отличаться. Но профи как раз поймут идею. В данном случае я выявляю по сути психологические различия HR и не HR as is, по факту, как сложилось. В задаче профориентации мы должны работать по лучшим экземплярам и из прошлого в будущее. Это более серьезные и трудоемкие исследования. Надеюсь, мы дойжем до этого.

К сути поста

Я провожу исследование факторов текучести персонала (исследование открыто, ждет вашего участия), где респонденты помимо всего прочего указывали свою профессию, а потом, по желанию, проходили бонусом батарею тестов от Лаборатории Гуманитарные Технологии по следующим шкалам:

  1. Общий балл теста способностей;     
  2. Вербальный IQ;                                                                                                       
  3. Эрудиция;                                                                                                        
  4. Числовой IQ;                                                                                                 
  5. Обработка информации;                                                                                             
  6. Интроверсия - экстраверсия;  
  7. Независимость - согласие;                                                                                        
  8. Импульсивность - самоконтроль;    
  9. Тревожность- стабильность;                                                                                       
  10. Консерватизм- новаторство.

Я сделал совершенно банальную вещь: поделил всех респондентов по признаку HR / не HR и построил прогнозную модель. В модель помимо результатов тестов добавил только пол и возраст респондента. Задача звучала для меня так: можем ли мы по полу, возрасту и результатам психологического тестирования предсказать, работает ли респондент HR-ом или нет. Или по другому, мы можем составить некий психологический портрет HR.
Почему именно HR? А потому что в выборке на сегодня 459 респондентов, кто прошел исследование и тесты, из них 256 HR, что составляет 56 %. Выборка почти идеально сбалансирована))). Это не закрывает возможности анализа психологических портретов других профессий: я с большим удовольствием сделаю аналогичный анализ для продавцов, айтишников и т.п.. Причем, по тем же продавцам можно сделать анализ по отраслям... Будут данные, будут путешествия результаты
Здесь пора в очередной раз открыть рот недоаналитикам, что выборка нерепрезентативна. Ок, нерепрезентативна. Сделайте ее репрезентативной, приняв участие в опросе.

Результаты

Начну сразу со вкусного, чтобы не отвалились не профи. Прогнозная модель лучше выбора монетки, а это уже приятный шок, факторы по важности распологаются таким образом
Психологические портрет HR: чем HR отличается от других профессий

Величина столбика обозначает важность фактора в различении профессии респондента, М и Ж это пол как вы догадались, остальные - шкалы теста. И самый важный фактор - пол. Думаю, всем очевидно, как HR по полу отличаются от других профессий. Прежде чем рассказать характер отличий HR от других профессий по психологическим качествам, я расскажу про точность модели.

Точность модели

Общая точность модели получилась = 0,7. Не забываем при этом, что базовая точность равна 0, 56 (отношение HR к не HR в выборке), поэтому прирост точности выше плинтуса. Про следующие ниже картинки даже не знаю, что говорить, аналитики поймут, не аналитикам рекомендую ходить на мои семинары.
ROC кривая
Психологические портрет HR: чем HR отличается от других профессий

Precision-Recall кривая
Психологические портрет HR: чем HR отличается от других профессий
Не фонтан, конечно, но я модель тренировал на accuracy, а не f1, и на скорую руку, поэтому теоретически можно чуть поднять точность даже на этих данных.

Самое вкусное

Как бы про психологический портрет. Шкалы различий вы уже увидели, теперь как по этим шкалам различаются HR и не HR.

Числовой IQ

После пола по важности у нас стоит числовой IQ
Психологические портрет HR: чем HR отличается от других профессий

По оси X - уровень показателя по тесту, синие - это HR, красные - остальные. Думаю, HR -ы без особого труда переживут этот удар: уровень числового IQ у специалистов по управлению персоналом значимо ниже аналогичного уровня других профессий.
Тоже самое, только на диаграмме плотности (тот же числовой интеллект, теже HR и не HR, но способ визуализации другой)
Психологические портрет HR: чем HR отличается от других профессий

Возраст

Психологические портрет HR: чем HR отличается от других профессий
Ожидамые различия: кого у нас берут в рекрутеры? Ага, молодых девушек.

Пол

уговорили добавить, добавляю
Психологические портрет HR: чем HR отличается от других профессий
Это нормированная таблица сопряженности говорит нам, что среди остальных профессий мужчины и женщины ровным слоем намазаны (52 на 48 % и это нормально, потому что в целом "женские" профессии перекрываются мужскими), то в HR соотношение 86 % женщина на 14 % мужчин.

Интроверсия и Экстраверсия

С эрудицией и общим балом по IQ все также, как и с числовым интеллектом, а вот что нам дают личностные качества. "Очевидно" же, что HR работают с людьми, должны быть экстравертами.
Психологические портрет HR: чем HR отличается от других профессий
А вот и фигушки вам. Медианы одинаковые, но у HR левый хвост уходит в интроверсию, а у не HR - в экстраверисю.
Или, по другому: три четверти или 75 % HR имеют показатели по шкале Интроверсии Экстраверсии ниже 6 балов.
Вы мне не рассказывайте про Comp&ben - это следующий этап исследования, прекрасно же понимаете, что основная масса респондентов от HR - рекрутеры, которые как бы должны быть чрезвычайно общительными.
В этом месте я ставлю запятую, напоминаю про участие в исследовании и если


пятница, 4 ноября 2016 г.

Связь зарплаты и компенсационного пакета

Вытащил еще данные из нашего исследования.
Респонденты у нас указывали размер своей зарплаты (я взял только россиян - в рублях) и опции компенсационного пакета. Опции компенсационного пакета были такие (сначала как в опросе, а рядом - сокращение до одного слова):
  1. корпоративное питание - питание
  2. ДМС - ДМС
  3. мобильная связь - связь
  4. проезд в транспорте - транспорт
  5. льготные путевки в санатории (для детей в т.ч.) - санатории
  6. абонемент в фитнес-центры (бассейны, спортзалы) - фитнес
  7. льготные кредиты - кредиты
  8. обучение за счет компании - обучение
  9. другое - другое
Вопрос с множественным выбором, т.е. респонденты могли выбирать несколько опций.
Идея поста простая: найти связь между зарплатой респондентов и компенсационным  пакетом. Поскольку мы не знаем размер компенсационного пакета в рублях, то связь зарплаты могли проверить только с:
  1. качеством или наполнением компенсационного пакета (буквально - какие опции входят в компенсационный пакет);
  2. количеством опций компенсационного пакета.
Начну со второго, чтоб сразу показать размер выборки.
Связь зарплаты и компенсационного пакета

Всего выборка состоит 2 037 респондента, на диаграмме выше частота встречаемости опций компенсационного пакета. В сумме опции дают более 2 037, поскольку вопрос с множественным выбором. Только опция "ничего" обозначает, что респондент не указал ничего. Я бы не рекомендовал смотреть на эту диаграмму как на некий бенчмарк компенсационного пакета, поскольку наша выборка явно смещенная (почти 50 % респондентов - HR-ы), поэтому я не беру на себя ответственность говорить за весь рынок.
На диаграмме ниже - частота опций компенсационного пакета.
Связь зарплаты и компенсационного пакета

Почти 500, а точнее 493 респондента не указали опций компенсационного пакета, мы это принимаем как отсутствие компенсационного пакета. Самый популярный вариант - одна опция.
Здесь нас ждет разочарование: на тренировочном сете R^2 показал 0, 019, а на тест сете - 0, 000.

Качество и наполнение компенсационного пакета

Здесь более интересная картинка. Хотя метод анализа может быть оспорен, но зато он оригинален. Хотя у нас вопрос был вопрос с множественным выбором, я ответы принял как текст. И анализировал как текст, провел анализ тональности текста, где управляемой переменной была зарплата, а зависимая переменная - компенсационный пакет как текст.
В этом месте скажу (этот кусок для профи), что стоит еще попробовать кластерный анализ, чтобы понять, как группируются опции компенсационного пакета. И я уже делал аналогичный анализ Пакетное управление компенсационным пакетом (какие опции компенсационного пакета надо совмещать), где я показал связь между кластерами (пакетами компенсационного пакета) и текучестью персонала. Можно было бы поступить также, но у меня родилась идея, что би граммы, три граммы и т.п. по сути и есть сочетания опций компенсационного пакета.
Давайте посмотрим, что получилось.
Связь зарплаты и компенсационного пакета

  • По X - прогнозные значения зарплаты;
  • Y - фактические значения
Диаграмма по тест сету, R^2 = 0, 07. Я использовал ридж регрессию, и можно было бы улучшить показатели, но меня в данном случае интересовало само наличие связи. Картинка убеждает, согласны?

Характер связи

Вам уже знакома такая форма представления результата
Связь зарплаты и компенсационного пакета
На картинке выше сочетания опций компенсационного пакета , которые связаны с более высокой зарплатой. Одним цветом показаны сочетания, а размер шрифта - вес в зарплате. Т.е. ДМС и мобильная связь вместе показывают более высокую зарплату респондента. Далее 2) мобильная связь и транспорт, 3) корпоративное питание и ДМС и 4) ДМС и льготные кредиты
Связь зарплаты и компенсационного пакета
На этой картинке показаны опции, связанные с низкой зарплатой. На первом месте те, кто указал льготные путевки или фитнес. И что неприятно удивляет, ДМС и связь в разных сочетаниях дают негативную связь.
Но профи, наверное, уже поняли фишку: у нас независимая переменная смещенна: почти 45 % респондентов указали мобильную связь как опцию своего компенсационного пакета и 40 % - ДМС.
Но другой примечательный факт: отсутствие опций компенсационного пакета не связан с низкой зарплатой.
Готов услышать ваши соображения.
И готов данные спецам с тем, чтобы вы провели кластерный анализ.

Понравился пост?

если Вы захотите выразить мне благодарность за интересный пост, вы можете перевести небольшую сумму мне на Яндекс кошелек (кликните по кнопке Перевести) 
или сделать перевод на карту Сбербанка,
Номер карты 676 280 38 921 538 46 57 
Или просто покликайте на директ рекламу ниже на странице - у вас это отнимет несколько секунд, а мне принесет немного денег. 

среда, 2 ноября 2016 г.

Бенчмарки зарплат HR по годам, отрасли, уровню позиции, знанию языка

Несколько картинок про зарплаты из нашего исследования Ключевые факторы удержания и текучести персонала.
Думаю, со временем перейдем на он лайн сервис, который сам будет показывать картинки по вашему запросу и вашим же фильтрам.
Ну пока не умею так делать, поэтому статика)
Еще раз: брал только HR. По остальным позициям просто мало данных. Развожу руками: участвуйте в опросе, чтобы получать красивые картинки.

Динамика зарплат HR по годам

Бенчмарки зарплат HR по годам, отрасли, уровню позиции, знанию языка

Заметно, что с 2012 года зарплата не растет (зарплата указана в тысячах рублей).
Теперь тоже самое, но в разрезе территорий Москва/не Москва
Бенчмарки зарплат HR по годам, отрасли, уровню позиции, знанию языка
Удручает разрыв между Москвой и не Москвой?

Отрасль

Бенчмарки зарплат HR по годам, отрасли, уровню позиции, знанию языка
Мне кажется, я понимаю, почему проседают зарплаты в Промышленность и ИТ.
Причины, причем, разные. Вы согласны со мной?

Уровень позиции

У нас в опросе есть вопрос про уровень позиции. Обратите внимание, это самооценка уровня позиции самим респондентом.
Бенчмарки зарплат HR по годам, отрасли, уровню позиции, знанию языка
Удивляет нижний край зарплаты руководителей высшего звена?

Знание языка

Бенчмарки зарплат HR по годам, отрасли, уровню позиции, знанию языка
А вот здесь вопрос на засыпку: понимаете ли вы смысл выражения "Корреляция не есть причинность"

Понравился пост?

если Вы захотите выразить мне благодарность за интересный пост, вы можете перевести небольшую сумму мне на Яндекс кошелек (кликните по кнопке Перевести) 
или сделать перевод на карту Сбербанка,
Номер карты 676 280 38 921 538 46 57 
Или просто покликайте на директ рекламу ниже на странице - у вас это отнимет несколько секунд, а мне принесет немного денег. 

Фотография текучести персонала одной компании

Хочу просто одной картинкой показать данные одной производственно-торговой компании.
Фотография текучести персонала одной компании
Как читать такой тип диаграммы - Анализ и визуализация дожития: чем HR похож на медиков.
По оси X - число месяцев стажа
По оси Y - вероятность, что работник доработает до этого момента стажа в компании.
Я опубликовал ради, собственно, двух вещей:

  1. А сейлзы бегут, действительно, быстрее Офиса, а Производство медленнее сейлзов, но быстрее Офиса, причем, одна только эта переменная имеет серьезный вес: если вы знакомы с понятием РОК кривая, то показанное на картинке рассеяние дает 62 % площади под кривой, если не знакомы, то если у нас точность прогноза с помощью монетки дает 50 % вероятность, а точность с помощью знания только категории должности работника дает 62 % точность. 
  2. Но все это ерунда по сравнению с тем, что отражено в осях. А по оси X у нас месяцы стажа, и 120 обозначает 10 лет, а по оси Y - вероятность дожития, и нижняя граница упирается в значение 75 %. Таким образом, ответьте на вопрос, насколько серьезно стоит проблема текучести в данной компании. 

воскресенье, 30 октября 2016 г.

David Green. Существует ли HR аналитика

На семинарах часто задают вопрос: а есть ли компании, где HR аналитика в принципе существует? Речь идет о:
  • Не репортинге, системе отчетности или дашбордах, а о предиктивной аналитике;
  • И не просто об отдельных кейсах, которых уже достаточно накопилось, а о HR-аналитике как системе, как о практике аналитики.
Отвечаю: есть. Именно как система. Рекомендую статьи английского People Analytics leader, David Green.
Эти статьи не столько про решения, сколько про опыт компаний, про шишки, которые менеджмент набивает по ходу внедрения решений. Это будет интересно менеджерам, руководителям HR-аналитики, кто решится на такое внедрение у себя в компании "по взрослому".
Я уже давал ссылки на часть статей в своем цикле статей по hr-аналитике, теперь дам все вместе.
В статьях ниже представлен обзор практик HR аналитик компаний Google, Shell, Nielsen, ISS, Opower, Gap, Microsoft, ATB Financial, Cisco, BNY Mellon, LinkedIn, ABN AMRO, IBM, Coca-Cola Enterprises, Walmart, Salesforce,JetBlue, Virgin Media, Unilever, Nestlé. Впечатляет список, верно? Далеко не в каждой компании выстроены системы, но везде была какая-то движуха в сторону построения системы hr-аналитик.
И уже более конкретные примеры - интервью с командами hr-аналитиков. Нашим практикам эти интервью будут особо ценны.
Обратите внимание, что здесь далеко не только IT отрасль (я отвечаю на вопрос коллег, что HR-аналитика возможна только в компаниях типа Google, где сама компания работает на цифрах. Нет, оказывается не Google единым полна HR-аналитика).
Что в России? Если вы знаете компанию, которая выстраивает систему предиктивной hr-аналитики, напишите мне edvb@yandex.ru, я с удовольствием расскажу об опыте этой компании.

Понравился пост?

если Вы захотите выразить мне благодарность за интересный пост, вы можете перевести небольшую сумму мне на Яндекс кошелек (кликните по кнопке Перевести) 
или сделать перевод на карту Сбербанка,
Номер карты 676 280 38 921 538 46 57 
Или просто покликайте на директ рекламу ниже на странице - у вас это отнимет несколько секунд, а мне принесет немного денег. 

воскресенье, 23 октября 2016 г.

Можно ли определить интеллект работников по отзывам о компании

Ответ: можно.
Далее прошу троллей покинуть блог, а для остальных еще расскажу немного.
У меня нет никакой цели поерничать на тему отзывов, интеллекта и т.п. Чисто исследовательская цель.
Большая часть текста этого поста во многом вызвана реакцией на мой пост в Линке, где я написал, что определить интеллект по профилю в социальной сети достаточно тривиальная задача, несмотря на революционность идеи. Реакция была в 90 % случаев неадекватной, а мне бы хотелось, что вы понимали, что это обычная исследовательская задача, и у меня пока нет возможности определить интеллект по профилю в соц сетях, для этого просто требуется больше ресурсов для сбора данных, но я покажу как можно определять интеллект по отзывам о работодателе.
Пост, наверное, не очень практичный, ибо какая польза работодателю от того, что он по отзыву о компании определит интеллект работника. Хотя как вариант, мы могли бы создать процедуру оценки, основанную на отзыве о прошлом работодателе. Но здесь уже полет фантазии может унести нас далеко от сути поста. Но с другой стороны, если вы почитаете обсуждения про exit интервью в компании (это обсуждение в моей группе HR-аналитика на Линкедине, приглашаю вступить), то заметите, что единицы в принципе ставят вопрос о целях использования результатов exit интервью и отзывов о компании.
И да, для меня exit интервью и отзыв о компании это почти одно и тоже.
Этот пост - возможность поиграться с данными моего исследования факторов текучести персонала (я надеюсь, что вас заинтересуют результаты исследования, вы пройдете по ссылке и поучаствуете в исследовании).
Я увлекся анализом тестов и анализом тональности текста. Кстати говоря, 24 ноября мы с Людмилой Роговой (второй автор этого блога) проведем вебинар От резюме до exit-интервью. Текстовый след сотрудников - как его посчитать и извлечь выгоду, присоединяйтесь! Самый популярный материал из этой серии Какой функционал HR самый дорогой или кто в HR получает больше. Он более практичен и поэтому, видимо, популярен. Думаю, что со временем, джоб сайты будут использовать именно эту технологию / алгоритм для бенчмарков зарплат.

Постановка задачи

В исследовании факторов текучести персонала появился на так давно новый вопрос. Вопрос просьба оставить отзыв о компании: причины увольнения, плюсы и минусы компании, особенности корпоративной культуры и т.д... Вопрос открытый, респонденты пишут все, что хотят.
А кроме того, у нас есть договоренность с Лабораторией Гуманитарные Технологии о том, что все, прошедшие исследование респонденты могут бонусом пройти батарею психологических тестов, которая состоит из теста Большая пятерка (личностный опросник про интроверсию / экстраверсию, независимость / согласие, импульсивность / самоконтроль и т.д..) и КТО (тест способностей: вербальный, числовой интеллекты, эрудиция и т.п.). Оцените компанию! Это волшебный дар по настоящему.
Так вот, у меня есть возможность сметчивать результаты респондентов по опросу и результаты тестов. По сути, у нас к результатам исследования факторов текучести добавляется еще куча информации.
И мы, таким образом, можем выявлять связи между психологическими качествами респондента и любым другим показателем его из исследования. Уверен, что никто не будет возражать против того, что есть связь между определенными профессиями и психологическими качествами. Например, выдвигаю гипотезу, HR и IT почти наверняка различаются в интеллекте (уж простите, коллеги!), а может быть и по экстраверсии / интроверсии. Абсолютно точно можно сказать, что есть связь между полом и психологическими качествами. С этой точки зрения, отзыв о компании такая же переменная, как и профессия респондента, как и пол.
Разница только в том, что отзыв о компании представляет из себя текст, а текст это неструктурированная информация. Поэтому задача аналитика заключается в том, чтобы сначала предобработать текст, привести его к формату цифр, а потом уже проводить анализ.
Так что выявление связи между интеллектом работника и его отзывом о компании задача революционная только в том, что раньше этого никто не делал. И в принципе не слышал, чтобы проводились исследования выявления связи между текстами и психологическими качествами людей. Навскидку назову несколько интересных гипотез, которые я обязательно проверю в своем исследовании (пишу гипотезы!!!):
  • Более импульсивные люди ставят чаще восклицательные знаки в тексте, чем менее импульсивные;
  • Более импульсивные люди чаще используют ВЕРХНИЙ РЕГИСТР ТЕКСТА в сообщении, чем менее импульсивные;
  • Люди с более высоким вербальным интеллектом пишут грамотнее, чем с низким;
  • Экстраверты используют больше слов в отзывах, чем интроверты;
  • ..... могу писать долго, следите за блогом. И очень хотел бы, чтобы вы мне подсказали гипотезы, которые можно проверить.

Собственно в тему поста

Так вот сегодня первый пост из этой серии. Участвуют в исследовании не очень активно, отзывы оставляют не все респонденты, и тесты проходят не все респонденты, кто оставил отзыв, но кушать очень хочется уж больно невтерпеж, поэтому я показываю анализ на примере 51 респондента, у кого есть данные как по тесту, так и отзыв о компании. Поэтому на результат нужно смотреть всего лишь как на возможность, на перспективу. И может быть вас это подхлестнет поучаствовать в исследовании.
Я построил уравнение регрессии, где y - вербальный интеллект, а X - отзывы о компании.
Гипотеза проста: то, как мы думаем и пишем, определяет наш интеллект! Так и хочется вспомнить работу Льва Семеновича Выготского "Мышление и речь", которую изучал любой советский / российский психолог, получивший классическое образование в ВУЗе. И данный пост - мой вклад в российскую психологическую науку.
Поскольку респондентов было мало, я не проводил ни разбиения на трейн и тест сет, ни кросс валидации, а просто построил ридж регрессию.
И результат получился слишком красивым: R^2 = 0. 64
Это был бы фантастический результат, если бы мы получили его на достаточной выборке с соблюдением всех требований алгоритма машинного обучения.
НО! Если мы в итоге получим R^2 = 0. 064, то это будет крупным успехом.
Ну и просто для красоты две картинки
1) слова и словосочетания, которые связаны с низким вербальным интеллектом. Т.е. те респонденты, которые использовали эти слова или словосочетания, чаще показывали более низкий результат по вербальному интеллекту. (упаси вас бох не пользоваться этим теперь в текстах)))
Можно ли определить интеллект работников по отзывам о компании
2) слова и словосочетания, которые связаны с высоким вербальным интеллектом (ща как начнут все пользоваться этими словами, ага)
Можно ли определить интеллект работников по отзывам о компании

Понравился пост?

если Вы захотите выразить мне благодарность за интересный пост, вы можете перевести небольшую сумму мне на Яндекс кошелек (кликните по кнопке Перевести) 
или сделать перевод на карту Сбербанка,
Номер карты 676 280 38 921 538 46 57 
Или просто покликайте на директ рекламу ниже на странице - у вас это отнимет несколько секунд, а мне принесет немного денег. 

пятница, 21 октября 2016 г.

Статьи по hr-аналитике на английском 7

Очередной выпуск, уже седьмой, статей по HR-аналитике на английском.
Последний выпуск был аж 24 августа см. Статьи по hr-аналитике на английском 6, через нее вы сможете выйти на все выпуски.
За прошедшее время накопилось много статей, много материала, делюсь.


И на десерт расстановка ролей в команде HR аналитиков компании Нестле
Статьи по hr-аналитике на английском

Понравился пост?

если Вы захотите выразить мне благодарность за интересный пост, вы можете перевести небольшую сумму мне на Яндекс кошелек (кликните по кнопке Перевести) 
или сделать перевод на карту Сбербанка,
Номер карты 676 280 38 921 538 46 57 
Или просто покликайте на директ рекламу ниже на странице - у вас это отнимет несколько секунд, а мне принесет немного денег. 

четверг, 20 октября 2016 г.

Новые книги по анализу данных в Python и R от ДМК-Пресс

Новые книги по анализу данных в Python и R от ДМК-Пресс
И еще несколько книг от ДМК-Пресс.
Начинать лучше с Python и анализ данных. Книга базовая, это как про excel. Описывать все будет нереально в одном посте, скажу только ведущие российских курсов на курсере дают эту книгу в качестве базовой.
Построение систем машинного обучения на языке Python - по ссылке полный анонс. Эта книга самая лучшая книга по машинному обучению в Pyhon. Краткий набор задач:

  • Анализ тональности сообщений в twitter;
  • Тематическое моделирование по текстам Википедии;
  • Прогноз стоимости домов в Бостоне;
  • Создание рекомендательной системы;
  • Анализ корзины покупателей
  • и т.п..

Книга на Озоне>>
Скрапинг веб-сайтов - это самая долгожданная книга:)
Люда Рогова уже показала кратко возможности использования скрапинга сайтов:


Скачала отзывы работников / кандидатов банков с сайта банки.ру и провела математический анализ. Так что теперь я к книге буду обращаться часто и показывать возможности скрапинга и анализа "скрапленных" данных.
Анализ сетей (графов) в среде R - эта книга на языке R. По ссылке полный анонс. Я скажу здесь очень кратко: анализ графов (сетей) даст новый импульс развитию HR-аналитки.
Книга на Озоне>>

суббота, 15 октября 2016 г.

Построение систем машинного обучения на языке Python



Построение систем машинного обучения на языке PythonПродолжаю знакомить с книгами издательства ДМК Пресс. Сегодня представлю Построение систем машинного обучения на языке Python автора Луиса Педро Коэльо.
самую зачитанную мной книгу -
Эта книга не про обучение Python, а про решение бизнес-задач с помощью Python. Каждая глава - это объяснение работы какого-то алгоритма на реальном примере. Начинается с всем известного кейса про Ирисы, и дальше даются известные кейсы, которые можно чуть не один в один применять для решения своих задач.

  • Анализ тональности сообщений в twitter;
  • Тематическое моделирование по текстам Википедии;
  • Прогноз стоимости домов в Бостоне;
  • Создание рекомендательной системы;
  • Анализ корзины покупателей
  • и т.п..

И как в любой нормальной книге по машинному обучению, дается ссылка на аккаунт автора на github Luis Pedro Coelho. Там даются примеры кодов, там можно задать вопрос автору. Я уже задавал и получил ответ:)
Кстати, вот этот пост Какой функционал HR самый дорогой или кто в HR получает больше был написан частично с решениями из этой книги
В качестве резюме: книга содержит набор базовых кодов под решение наиболее распространенных бизнес-задач
Книга на сайте изд-ва ДМК-Пресс>>
Построение систем машинного обучения на языке Python на Озоне>>

Также рекомендую другие книги ДМК Пресс:
Книги по анализу данных от ДМК Пресс
R в действии. Анализ и визуализация данных на языке R - эту особенно для начинающих
Наглядная статистика. Используем R!
Сбор данных в Интернете на языке R
Анализ сетей (графов) в среде R


пятница, 14 октября 2016 г.

Про факторы эффективности команды (кейс)

По договоренности с одной компании публикую анонимно результаты исследования анализа факторов эффективности команд.
Данные абсолютно реальные, правда, там еще копать и копать. Поэтому я покажу только первый копок лопатой.
Логика простая: у нас есть несколько десятков филиалов (я в посте буду под командой понимать филиал, хотя в строгом смысле слова команда отличается от обособленного подразделения, но мне важно, что у филиала есть ясный финансовый результат, над достижение которого направлены усилия всех работников филиала), по которым известны:
  1. финансовая эффективность (мы их закодировали как 1 и 0 - эффективные /неэффективные);
  2. данные работников филиалов: пол, возраст, семейное положение, стаж, результаты тестов. 
Т.е. мы анализ свели фактически к выявлению влияния личных показателей работников на результаты команды. Мы не брали ни данные руководителя, ни совокупный командный эффект, ни макроэкономические показатели и т.п..
Эта задача по структуре идентична задаче Moneyball: задача Билли Бина сводилась к тому, чтобы вывести команду в финальную стадию игр (результат: 1 - вышел, 0 - не вышел), а уравнение регрессии содержало в себе только одни личные показатели игроков: % занятия баз и количество полных пробежек. Все. Правда, сейчас уравнения бейсбольной логи стали усложняться, некоторые результаты не попадают в рамки личных, результатов. Не могу нарыть статью у себя в блоге, я там цитировал статью, где выходили на понимание "командности" в объяснении результатов бейсбольной лиги.
Мы же пока не дошли до командности, только личные данные.
Итого, задача свелась к выяснению, есть ли различия в данных работников среди эффективных / неэффективных команд / филиалах.

Результат

Модель прогноза оказалась слабой.
Про факторы эффективности команды (кейс)
0, 5 означало бы отсутствие различий в эффективных / неэффективных командах, 1 - что мы можем идеально разделить команды на эффективные и неэффективные по личным данным. В нашем случае показатель равен 0, 55. Т.е. пациент скорее мертв, чем жив.
Но с другой стороны, я бы не рекомендовал в этих ситуациях плакать или разочаровываться: на результат работы филиала влияют куча факторов: от маркетинговой стратегии компании, узнаваемости бренда до месторасположения филиала. И например, продавцам продукции Apple не платят % с продаж - ибо а нафик, если весь объем продаж определяется известностью бренда и покупателю совершенно пофик, кто стоит за прилавком, его интересует какой то там по счету прибамбас от яблока.
Мы могли бы сильнее переживать в случае если бы строили модель индивидуального результата, как например здесь Кейс по прогнозу эффективности работников. Было бы странно, если личный результат не был бы связан с личными же данными.
И что такое 100 % различие филиалов на основе личных качеств? Это значит, что все 100 % эффективных филиалов отличаются от работников неэффективных филиалов. Это нереально хотя бы потом, что руководитель филиала связан ТК РФ, который не позволяет увольнять только на основе желания руководителя.
В нашем случае мы определили, что имеющиеся данные работников позволяют отличать  эффективные филиалы от неэффективных вот на столько.
И либо мы собрали мало информации, либо на большее мы и рассчитывать не можем.

Важность факторов. 

А вот это самое интересное.

Количество новичков. 

У нас были данные о стаже работников до прихода в компанию. Я поделил всех работников, у кого нулевой стаж -0- т.е. работник сразу пришел в компании, или у него был уже рабочий стаж - 1. И посмотрел как соотношение работников с белого листа влияет на эффективность.
Про факторы эффективности команды (кейс)
На этой картинке в строках - филиалы (1 - эффективные, 0 - неэффективные), в колонках новички (1 -имеет стаж до прихода в компанию, 0 - не имеет). И в ячейках - % по строкам, т.е. в эффективных филиалах 29 % - люди с чистой трудовой, а в неэффективных - 18!!
Хи квадрат дает p-value - 0.00770234632843655
Круто? Предвижу: найдутся сейчас офигенные гуру, которые скажут: ну это же очевидно, мол, лучше вырастить под себя, чем брать с устоявшимися привычками и т.п. Ну я тупой, мне это не очевидно.

Стаж работы в компании

Ок, мы можем смело брать людей после институтской скамьи. Но давайте посмотрим на стаж работы в самой компании.
Про факторы эффективности команды (кейс)
Запомнили уже, что 1 это эффективные филиалы? Для эффективных филиалов медиана стажа - 48 месяцев, для неэффективных - 72. 4 года и 5, 5 лет.
Крусскал Уолисс pvalue=0.011351051697263165. Ну может не самое крутое различие, но визуально приятное и, главное, наводит на определенные мысли про сменяемость поколений.....

Личностные качества

Единственная личностная характеристика, которая показала значимые различие в психологическом портрете, относится к коммуникативным характеристикам: уверенность в себе, умение устанавливать контакт, активность в установлении контактов.
Про факторы эффективности команды (кейс)
И интеллект не показал значимых различий в коллективах филиалов.

Обсуждение результатов

Я не буду проговаривать здесь те выводы, которые напрашиваются. Они очевидны. Вопрос в том, как это применять. И вот здесь я скажу методологическую вещь.
Я задачу поставил с ног на голову: по работнику определял, какой у нас филиал - эффективный или неэффективный. Задача как бе некорректная - это филиал / руководитель выбирает работника, а не работник выбирает филиал. Ну кроме случаев, когда кандидаты идут в намеренно успешные филиалы.
Так вот задачу я сформулировал, исходя из простой в общем мысли, что команду подбирает руководитель, что в основе различия личных качеств работников команд / филиалов лежит стратегия подбора команды: не бояться обновлять команду или опираться на старых пердунов.
Поэтому рекомендации компании по дальнейшим шагам:

  • смотрим различия по руководителям: как личностные качества, так и то, как эти руководители попали на руководителей - извне или изнутри филиала, какие показатели тестов, какой предыдущий опыт;
  • смотрим различия по набору команд. Самое первое действие: сравнить стаж руководителя и стаж команды. Если стаж команды меньше стажа руководителя, значит, он засранец набирает новеньких;
  • сметчить показатели руководителя и посмотреть как в связке данные работают - это будет про собственно психологическую совместимость;
  • Дать вес разным позициям в команде и посмотреть, как влияют на эффективность разных позиций влияет в связке с руководителем на эффективность, тогда выяснится, что дворников можно и не менять, а аккаунт манагеров надо гнать метлой того же дворника.
  • Добавьте свои варианты, что еще посмотреть....

Понравился пост?

Делал я эту работу бесплатно, если Вы захотите выразить мне благодарность за интересный пост, вы можете перевести небольшую сумму мне на Яндекс кошелек (кликните по кнопке Перевести) 
или сделать перевод на карту Сбербанка,
Номер карты 676 280 38 921 538 46 57 
Или просто покликайте на директ рекламу ниже на странице - у вас это отнимет несколько секунд, а мне принесет немного денег. 

Путь воина. Про блог Сергея Багузина

ПРИГЛАШАЮ ОТСЛЕЖИВАТЬ НАС В ТЕЛЕГРАМ


Искал информацию по скрапингу данных с помощью Питона (даже не спрашивайте, что это) и наткнулся на блог старого знакомого - Сергея Багузина Скрапинг веб-сайтов с помощью Python. Можно было бы поставить кавычки вокруг "старого" и/или "знакомого", но надеюсь, Сергей не обидится на "старого знакомого".
Мы познакомились в 2009 году, когда я пришел на сайт HRM. Сергей Багузин писал на форуме. Очень редко, но в темах типа обсуждения excel.
И этим он мне в первую очередь запомнился. Вызывает уважение готовность человека не просто тратить кучу своего личного времени на освоение excel, но и совершенно бесплатно делиться этим с публикой.
Правда, я сам считаю, что тот, кто делится, в итоге и получает больше - основной принцип Дао: "мудрец не копит, а расточает. И чем больше у других, тем больше у него". Если я правильно помню перевод трактата Лао цзы)
С этой точки зрения блог Сергея Багузина очень органичен.
После HRM мы потерялись из виду, и вот спустя какое-то время я вижу, что Сергей сам пришел к Python. И вроде бы логичный, но все-таки неожиданный результат. И книги те же, что на моей книжной полке:

Сергей погружается очень глубоко, читайте нпаример, пост Комплексное моделирование или бэггинг (bagging). Бэггинг - далеко не самый простой метод моделирования в машинном обучении, Сергей показывает, как это можно делать в excel. Я бы никогда не смог так глубоко показать, в лучшем случае сказал, бы какой код в Python это делает)
В качестве резюме я бы сказал так: сейчас очень много молодых людей, которые занимаются машинным обучением, статистикой и т.п.. Чаще всего эти люди получили пинок в ВУЗе, в тусовке и т.п. Сергей Багузин пришел к этому сам, через бизнес, через личное осмысление. Путь этот сложнее. Чаще всего идешь без огонька свечи ночью по лесу, обдирая кожу о сучья деревьев. Сергей проходит свой путь, он уникален и оригинален для нашего рынка.
Если вы наткнетеьс в поисковике по своему запросу на блог "Путь воина...." открывайте без сожаления, вы не потратите время зря, вы получите Знание.

ПыСы. 

Я попросил Сергея дать мне ссылку на пять любимых постов. Выкладываю. Надеюсь, вы составите через эти посты свое мнение о Сергее Багузине

  1. Левин. Статистика для менеджеров с использованием Microsoft Excel
  2. Дональд Уилер, Дэвид Чамберс. Статистическое управление процессами
  3. Нассим Николас Талеб. Антихрупкость. Как извлечь выгоду из хаоса
  4. Даниэль Канеман. Думай медленно... решай быстро
  5. Александр Остервальдер. Построение бизнес-моделей: Настольная книга стратега и новатора

ПРИГЛАШАЮ ОТСЛЕЖИВАТЬ НАС В ТЕЛЕГРАМ

Эрих Людендорф. Мои воспоминания о войне 1914-1918. Отзыв о книге

Прочитал наконец книгу Эриха Людендорфа Мои воспоминания о войне 1914-1918 гг.
Кратко, почему отзыв об этой книге в этом блоге: мне книги по военной стратегии
Эрих Людендорф. Мои воспоминания о войне 1914-1918. Отзыв о книге
дают гораздо больше с т.з. менеджмента, с т.з. понимания стратегии, чем книги по менеджменту.
И у меня уже богатый арсенал прочитанных книг по военной стратегии, см. Книги по военной стратегии.
Напомню, что английский военный историк Лиддел Гарт называл самым лучшим военачальником Первой Мировой войны именно Людендорфа. А Людендорф не был командиром, он был начальником штаба. В Германии вообще сначала искали начальника штаба, а уже к нему подыскивали командира.
Эрих Людендорф. Мои воспоминания о войне 1914-1918. Отзыв о книгеНа контрасте вспоминаются воспоминания Брусилова: в поезде он ехал вместе со строевыми офицерами, те ругали "штабных". Претензии простые: пороху не нюхали, теории много, вйны не знают. Брусилов защищал штабных, но соглашался с недостатками работы. В Германии такая история не была возможна. Генеральный штаб германской армии был местом обучения, местом генерации идей, см.  Генеральный штаб как учебный центр (или еще раз о культуре обучения). И Людендорф - один из лучших продуктов кухни германского генштаба.

Штабные навыки помогали Людендорфу лучше видеть картину боя. Если понимать под штабными навыки то, что сейчас в стратегии называют vision - уметь видеть дальше своего носа или поля боя. С началом Первой Мировой войны Людендорф не имел официальной должности, но он шел с первыми колонами в бой. По пути ему встречались паникеры, но он не обращал внимания на страсти. Он прорвался с небольшой группой немецких войск в бельгийский город Льеж. Немцы хотели сдаться: их было слишком мало, а подкреплений не было видно. Но Людендорф сам в одиночку пошел в крепость, предложил противнику сдаться. И сдался противник, а не немцы. И это говорит не только о смелости полководца, речь о видении ситуации.
Вместе с тем, если бы Людендорф родился сегодня, он был бы прекрасным менеджером. Большая часть его воспоминаний напомнили мне рассуждения бухгалтера. Он очень просто, обстоятельно обсуждает военные, хозяйские, политические вопросы. А хозяйственные вопросы тоже были: после того, как в 1915 году немцы захватили у России Польшу, Литву, западные Беларусь и Украину, то встали вопросы снабжения, экономики и т.п.
Из самых впечатляющих страниц - описание битвы Танненберга и последние месяцы войны.
Танненберг для нас - как повод вздохнуть и подумать: эх... вот если бы Реннекампф начал активнее наступать.... Ход войны был бы другой, возможно, Россия бы избежала революции и т.п.. Но увы..
Читайте, книга на Озоне>>