.

Сделать репост в соц сети!

пятница, 9 сентября 2016 г.

Заметки с Московской международной книжной выставки ярмарки

Блог про hr-аналитику, но чтение книг, саморазвитие, само отношение к книге считаю необходимым условием продвижения вперед, поэтому публикую пост про Московскую международную книжную выставку ярмарку с удовольствием.
У меня много постов про книги и книжную тему:


Это небольшая часть постов про книги. Буккроссинг я предложил выставке Трейнингс Экспо, и, насколько слышал, этот проект существует. Но этот пост про Московскую международную книжную выставку ярмарку.

Первая приятная новость

Начну с приятной новости (для меня и для кого-то, не знаю, пока еще кого)
Заметки с Московской международной книжной выставки ярмарки

Я продолжаю сотрудничать с издательством Манн, Иванов и Фербер, выпросил два экземпляра книги Голая статистика. Самая интересная книга о самой скучной науке.
Это, действительно, замечательная книга, один вариант я оставлю себе, другой вариант я подарю на конференции по hr-аналитике в декабре тому, кто мне понравится своими ответами на мои вопросы. Рекомендую Вам к прочтению. Эта книга может конкурировать с нашумевшей книгой Большие Данные Майер-Шенбергера. Тоже издательства МИФ.

Вторя приятная новость

Я купил последнюю книгу Эдварда Люттвака. По имени вы попадете на все посты с тегом Эдвард Люттвак, но обязательно прочтите пост Талант: опыт реализации проекта. Западный интеллектуал, который сам сделал себе карьеру.
Последняя книга - Возвышение Китая наперекор логике стратегии. Прикольно, что ее до сих пор ни на Озоне, ни в Лабиринте. Для меня книги Люттвака ценны логикой, стратегичностью, здравым смыслом и ясным анализом. Если Вам он показался интересен, почитайте его Стратегия Византийской империи. Эту книгу издательство Университет Дмитрия Пожарского (изд-во также рекомендую, классные книги выпускают, много редких и интересных книг по истории) переиздало, значит спрос есть.

Не самые приятные новости

Московская международная книжная выставка ярмарка откровенно загибается. Это видно по занимаемым площадям, по количеству посетителей, по характеру издательств. Не буду ругаться сразу на читателей: не уверен, что дело в снижении интереса к книге. Тут может быть много причин: есть серьезный конкурент в виде выставки Нон фикш, которая проходит в декабре, многие издательства поняли, что выставка не так уж много дает с т.з. продвижения, поскольку их слой читателей узок, кроме того, сама ситуация в стране, мне кажется, не способствует росту интереса к книге. Зато расцвели какие-то секстанстские издательства: религиозные, духовные, парапсихологические и т.п....
И несколько фото и видео
Куда же без Дмитрия Быкова
Вассерман тоже целый день выступал
Заметки с Московской международной книжной выставки ярмарки

И два видео

На первом видео хотел передать сам дух выставки - посмотрите, если хотите почувствовать.
На втором - читают текст Тотального диктанта. Зацените текст. И читайте книги. Удачи)

среда, 7 сентября 2016 г.

Анализ анкет обратной связи по обучению. Что нам могут сказать открытые вопросы.


Анализирую анкеты обратной связи по корпоративным семинарам. В анкетах помимо полей с цифровой оценкой семинаров есть поле обратной связи в виде открытого вопроса, участники могли писать про пройденный семинар все, что хотели.
В данном посте публикую подход к анализу, если заинтересуетесь, готов его обсуждать.

Проблема 

проблема использования подобных вопросов очевидна:
  1. пишут редко, т.е. вообще отзывов мало;
  2. а в имеющихся отзывах мало содержательной информации, в основном: "все было супер", "препод молодец!";
  3. И когда мы вытаскиваем наконец содержательные отзывы, например, про полноту и ясность раздаточного материала, то непонятно, является ли это субъективным мнением одного участника или отражает мнение хоть части группы. Потому что, если это субъективная оценка участника, то реагировать и работать надо с участником, а если отражает мнение, то работать надо с преподавателем / тренером.
  4. А теперь с учетом всего вышесказанного мы выходим на главную проблему: и кто после этого будет читать эти анкеты? Тренинг менеджер компании потратит два часа времени на чтение анкет, но сделать реальных выводов не сможет. 
Вот собственно для решения данных проблем я решил заняться анализом открытых вопросов анкет обратной связи

Решение

Неспециалистов сразу предупреждаю, что будут какие-то термины в области машинного обучения, которые могут показаться темным лесом, можно перейти сразу к результатам.
Первым заходом на решение проблемы была попытка построить кластеры отзывов: т.е. попытаться превратить все море тестовых отзывов превратить в несколько групп, связанных по смыслу. Выделю эти группы:
  1. раздаточный материал семинара;
  2. тренер;
  3. применимость полученных знаний на практике;
  4. организация семинара. 
Попытка эта не привела к успеху

Анализ анкет обратной связи по обучению. Что нам могут сказать открытые вопросы.
На картинке показана попытка разделить все отзывы на три кластера, качество модели настолько качественно, насколько кластеры отделены друг от друга.
Видно, что кластер 0 не существует практически, а кластеры 1 и 2 это если и не один кластер, то граница весьма условна. Причем, это видно по смысловому наполнению, когда слова "материал" или "тренер" содержаться во всех кластерах, что значит для нас, мы не смогли поделить отзывы по нужным нам смыслам.

Мера сходства сообщений.

Тогда я решил использовать меру сходства сообщений. Это почти тоже самое, что поисковая выдача: первым в поисковике выходит наиболее релевантное сообщение, а потом по мере убывания. Понятно, что Гугл и Яндекс делают это сложнее)))
Но я таким образом могу посчитать насколько каждый отзыв участника семинара / тренинга схож с эталонным сообщением, сообщением, который отражает нужный нам набор слов.
Например, я беру тему "Материалы семинара" и создаю набор слов, выражений:
"раздатка восприятие визуализировать наглядный раздаточный материал материалы ....".
Далее запускаю алгоритм машинного обучения, который определяет меру сходства каждого сообщения с этим эталонным. И каждое сообщение получает свою оценку сходства, которую я записываю отдельной переменной. У нас получается вот такая картина:

благодаря грамотный тренер группа активно участвовать замечательный живой яркий динамичный следить
1.41
тема форма подача информация изучить разобрать инструмент реализация личный цель
1.36

не обращайте внимание на "нерусский" текст, я его предобработал (убрал лишние слова, привел все в одну форму), поэтому он как бы не читаем. 
Но зато вы видите, что у одного отзыва стоит оценка 1, 41, у другого 1, 36. У того, что 1, 36 мы видим слово "подача", которое было приведено в эталонном сообщении. Поэтому данный отзыв имеет больше сходства с эталонным. И важный момент: мера сходства показывает не просто количество слов из эталонного сообщения, но относительную частоту, т.е. сколько слов эталонного сообщения по отношению к количеству всего слов в сообщении. Мы тем самым вводим вес этой темы для отзыва, т.е. учитываем, что если участникам написал только про материалы семинара, вес этого сообщения будет более значимым. 
Таким образом мы можем посчитать средние значения по каждому семинару / тренингу. Получается вот что. 

Семинар
Среднее значение меры сходства
1
Личная эффективность
1.403539
2
Навыки проведения презентации
1.398800
3
Навыки коммуникации
1.404731
4
Переговоры
1.403366
У нас максимальное различие определяется оценкой 1, 41. И таблица может ввести нас в удрученное состояние:
  1. слишком близки средние значения к 1,4 1 
  2. слишком невелико различие между средними.
Но давайте посмотрим на распределение оценок.
Анализ анкет обратной связи по обучению. Что нам могут сказать открытые вопросы.

Упс, у нас из 2853 анкет более 75 % вообще никак не связаны с нашим эталонным сообщением (это правый столбец на картинке, оно же значение 1, 41). И это нормально. Ну никак тема материалов семинара не затронула участников. В этом же числе отзывов и пустые отзывы. 

Дескриптивные статистики 

count    2853.000000
mean        1.403738
std         0.032555
min         1.051462
25%         1.414214
50%         1.414214
75%         1.414214
max         1.414214

Что мы делаем

Тем не менее, четверть отзывов так или иначе связана с темой материалов. И нам осталось понять, есть ли значимые различия в оценках средних значений семинара по теме "Материалы семинара". 
А это может сделать уже любой выпускник психфака, прошедший курс тервера и матстатистики. С помощью критерия Крускала и Краскелла Уолисса.
KruskalResult(statistic=15.880403258075576, pvalue=0.0011998352099500508) 
Значимость критерия ниже необходимого нам уровня в 0, 05 и даже в 0, 01, поэтому мы можем утверждать, что на семинаре "Навыки проведения презентации" тема материалов семинара поднималась в отзывах участников значимо чаще. Отсюда следующие шаги:
  1. мы проводим анализ тональности текста (отвечаем на вопрос, были ли эти отзывы чаще позитивными или негативным);
  2. даем обратную связь тренеру / преподавателю или принимаем решение о дальнейшей работе с ним.
Все. От профи по машинному обучению хочу услышать предложения, как можно сделать проще то, что я понаделал. Ибо я только начинаю тут шаги делать, а от коллег по HR хотелось бы услышать про перспективы применимости услышать. Спасибо. 

Понравился пост?

если Вы захотите выразить мне благодарность за интересный пост, вы можете перевести небольшую сумму мне на Яндекс кошелек (кликните по кнопке Перевести) 
или сделать перевод на карту Сбербанка,
Номер карты 676 280 38 921 538 46 57 
Или просто покликайте на директ рекламу ниже на странице - у вас это отнимет несколько секунд, а мне принесет немного денег. 
спасибо!

воскресенье, 4 сентября 2016 г.

Анализ обратной связи в оценке 360 градусов. Зарисовки.

Провожу анализ обратной связи в оценке 360 градусов одной компании. Хочу показать один результат. С разрешения компании.
Компании в оценке 360 градусов часто используют открытые вопросы, чтобы получить обратную связь, получить пояснения оценок и т.п.. Компании эти данные дают оцениваемым как обратную связь, но сама hr служба практически никак не анализирует тексты из-за объемов и отсутствия инструментов.
Но некоторые вещи можно вытащить.

Описание структуры оценки 360 градусов

В данной компании оценка 360 градусов проводилась по четырем компетенциям
  • Лояльность компании;                                                               
  • Ответственность;  
  • Ориентация на клиента;  
  • Эффективное общение.
И задавали два открытых вопроса:
  • В чем этот сотрудник особенно успешен, что получается у него особенно хорошо?  
  • Что бы Вы порекомендовали этому сотруднику изменить в своем поведении, чтобы стать более эффективным?
Первый вопрос был направлен на выявление сильных сторон, второй направлен на выявление слабых сторон.
Всего было оценено более 700 работников

Проблема 360 градусов

Надо обязательно отметить, что оценка 360 градусов имеет одну проблему.
Анализ обратной связи в оценке 360 градусов

На картинке показано распределение оценок 360 градусов по компетенции Ответственность . Шкала оценок от 0 до 2, где "2" - максимальная позитивная оценка. Диаграмма показывает, что "двоек" в оценках слишком много, в нашем случае две трети оценщиков оценили оцениваемых на максимальную оценку. Уверен, что любой, кто проводил оценку 360 градусов, сталкивался с подобным.
Сама по себе эта проблема требует решения, буду готов обсудить с заинтересованными способы решения этой проблемы.

Анализ и результаты

Я провел анализ тональности (сентимент анализ) текста. Анализ тональности позволяет выявить, какие слова, выражения чаще употребляются с позитивной оценкой оцениваемого (оценка "2") и негативной оценкой.
Установлено что вопрос "Что бы Вы порекомендовали этому сотруднику изменить в своем поведении, чтобы стать более эффективным?" позволяет лучше проводить границу между позитивной и негативной оценкой. Отсюда хочу для эксперимента порекомендовать не бояться задавать прямых, резких, провокационных вопросов в обратной связи.
А далее забавный результат
Анализ обратной связи в оценке 360 градусов
На картинке показан Топ 10 слов, связанных с негативными оценками в вопросе  "Что бы Вы порекомендовали этому сотруднику изменить в своем поведении, чтобы стать более эффективным?". Размер шрифта, высота слова / выражения показывает вес слова выражения с негативной оценкой в обратной связи 360 градусов. Чем крупнее слово, тем чаще оно используется в негативной обратной связи.
"Пусто" это не слово "пусто", а пустое пространство, или, точнее, отсутствие обратной связи. Т.е. когда оценщик ставит негативную оценку, он часто просто оставляет поле пустым. А на втором месте "затрудняюсь" и "затрудняюсь" ответить. По сути, равно "Пусто".
Вывод для компании: необходим тренинг научения давания негативной обратной связи. Извините за мой французский.
А теперь аналогичная картинка, но для позитивного вопроса "В чем этот сотрудник особенно успешен, что получается у него особенно хорошо?". Зацените: вопрос призван восхвалять оцениваемого, а мы выявили слова, которые связаны с негативом, оценщик ставит негативную оценку, а в поле восхвалений пишет ниже... "Затрудняюсь" и "Затрудняюсь ответить" тоже присутствует, но далеко не на первом месте (хвалить таки проще?)
Анализ обратной связи в оценке 360 градусов
На первом месте "клиент" (для спецов: лемматизацию я не делал), обратите внимание на картинке выше присутствуют "коллеги". Отсюда гипотеза: негатив чаще связан с самим любимым - оценщиком, с тем, что у тебя случилось с оцениваемым. А клиенты на закуску.

Понравился пост?

если Вы захотите выразить мне благодарность за интересный пост, вы можете перевести небольшую сумму мне на Яндекс кошелек (кликните по кнопке Перевести) 
или сделать перевод на карту Сбербанка,
Номер карты 676 280 38 921 538 46 57 
Или просто покликайте на директ рекламу ниже на странице - у вас это отнимет несколько секунд, а мне принесет немного денег. 
спасибо!

четверг, 25 августа 2016 г.

Мифы текучести персонала

Продолжаю серию мифов управлении персоналом. Первые мифы смотри здесь
Сегодня обсудим мифы текучести персонала. В данной статье What Drives Employee Turnover? Part 2 автор помимо прочего показывает драйверы текучести персонала. Среди этих драйверов два почти не вызывают сомнения:
  • семейный статус
  • наличие детей.
Любой скажет, что женатые / замужние работники  реже покидают работодателя, а наличие детей еще больше влияет на удержание работника. Логично же.
Однако мои исследования показывают
что ни семейный статус, ни наличие детей не влияют на текучесть персонала

на картинке показан анализ текучести персонала мужчин старше 35 лет с детьми и без детей.
Проблема в моих исследованиях? Выборка нерепрезентативна? У меня в данном исследовании приняло участие чуть более 800 мужчин старше 35, а американское исследование представляет собой мета анализ по данным более 60 000 работников ("In 2000, three scientists combined all existing literature on employee turnover. This resulted in a meta-analysis of over 60.000 employees! "). И данные исследования вызывают больше доверия.
И в предыдущих статьях у нас получалась забавная штука: мета анализ показывает, что ассессмент центр имеет высокую валидность, а мои исследования показывают, что валидность нулевая, нет ее.
Я не хочу ничего утверждать и доказывать, что я прав. Просто у меня возникают вопросы к мета анализу: а все-таки, что обозначает валидность по мета анализу? Было бы здорово услышать человеческую версию мета анализа.
Свою позицию я хочу выразить словами американского HR аналитика Richard Rosenow (из Сити Банка):
It's both shocking and fantastic that the Meta-Analysis that forms the basis of this article comes from the year 2000. The gap between ivory tower and practitioners is huge when it comes to predicting employee turnover.
Хочу вас просто предупредить: если вы видите результаты мета-анализа, будьте осторожны, проверяйте эти результаты на своей компании!

среда, 24 августа 2016 г.

Статьи по hr-аналитике на английском 6

Шестой выпуск просто сказочный на материалы оказался. Боюсь загадывать, но самый лучший, наверное.
Предыдущий выпуск здесь Статьи по hr аналитике на английском - 5. Через эту ссылку вы ко всем предыдущим постам перейдете.
Сегодня представляю статьи

  1. 13 People Analytics Ideas to Get you Started - Трейси Смит показывает перечень задач по HR-аналитике, с чего можно начинать. Хотя я бы сказал, что это и начало, и середина. Если вы этот перечень осваиваете, то можно сказать, вы достигли много в аналитике. 
  2. Predictive analytics in HR: Tutorial and 7 case studies - можете прочесть только эту статью, но прочтите обязательно. Это очень крутая статья с т.з. объяснения механизмов аналитики "на пальцах". Если вы понимаете такие статьи, вам не надо ходить на мой Семинар BigData для HR-директоров. В статье очень ясно, полно показываются алгоритмы и принципы анализа и дается несколько кейсов конкретных компаний. И на сам ресурс обратите внимание: ребята сделали классный ресурс по hr-аналитике. Не хуже, чем мой блог)))
  3. After Big Data: Is Your HR Team Prepared for the Future of Technology? - короткая, но емкая статья, а что дальше? Мне она точно интересно, посколько я вижу горизонты, а здесь мне их раздвигают.
  4. What Drives Employee Turnover? Part 2 - там же часть первая. Очень крутая статья, потому что автор перечисляет драйверы - предикторы - факторы, кому как нравится, текучести. Это то, от чего собственно надо отталкиваться в своих собственных исследованиях. Просто берите и начинайте работать по этим факторам. Не уверен, что у вас получатся аналогичные результаты. У автора, например, семейный статус и наличие детей влияют на текучесть, а я показал несколько раз (см. Неженатые мужчины старше 35 лет как фактор риска для работодателя и Удерживает ли мужчину в компании наличие детей), что нет). На тему этой статьи читайте продолжение Мифы текучести персонала
  5. Use Case for HR: Retaining your valuable employees - в этой статьей Watson Analytics себя рекламирует, но статья полезна тем, что там есть датасет в excel с реальными данными, которые вы можете самостоятельно проанализировать!

Удачи!
коллеги, если вам такие мои статьи нужны, напишите в комментах, чтобы я продолжал, ок? Я трачу время, не хочется тратить его в пустую

понедельник, 22 августа 2016 г.

Изучаем Spark. Молниеносный анализ данных



Изучаем Spark. Молниеносный анализ данныхЯ не буду вдаваться в том, что такое Spark, каково содержание книги.
Хочу рассказать про то, что, кажется, совсем недавно программа R была из разряда фантастики, нечто невероятным. И простой боксплот как кусочек мистики.
В Python я "въезжал" уже значительно быстрее. И в какой то момент я осознал, что это не вопрос моего выбора. Просто это путь, который надо пройти. И Spark это очередной поворот пути. Это, действительно, Большие Данные.
Параллельно изучаю курс по Spark на edx.org - от Databrics.
И если Вы развиваетесь в области аналитики - мимо Spark не пройдете, не пройдете мимо книги.
Я прорываюсь с трудом, мне это кажется сложным (это проходит), но повторюсь: это уже не вопрос моего выбора.
Удачи вам в изучении Spark.

  • Купить Изучаем Spark. Молниеносный анализ данных на Озоне
  • На сайте ДМК пресс - рекомендую обратить внимание на книги издательства, самое аналитичное издательство.

воскресенье, 21 августа 2016 г.

Бенчмарк зарплат HR по размеру компании

В продолжение темы исследования ключевых факторов текучести.
Бенчмарк зарплат HR по размеру компании (брал количество работающих). Под зарплатами я понимаю стартовые зарплаты - на какую зарплату кандидат приходит в компанию.
Простенькая аналитика, и пост будет коротким.
Выборка
По размеру компании выборка билась
до 25 работающих - 54 респондента (понятно, что это рекрутеры кадровых агентств и консалтеры);
  • 25-100 - 126 респондентов;
  • 100 - 1 000 - 441 HR;
  • 1 000 - 10 000 - 297 HR;
  • 10 000 - 50 000 - 87 HR;
  • более 50 000 - 42.

Результат

Бенчмарк зарплат HR по размеру компании

Дескриптивные статистики 

$`до 25`
   Min. 1st Qu.  Median    Mean    3rd Qu.    Max.
   5.00   13.75     22.50      31.82     40.00     150.00  

$`25-100`
   Min.   1st Qu.    Median    Mean    3rd Qu.    Max.  
   5.00     25.00     40.00       45.35      55.00     170.00  

$`100-1 000`
   Min.   1st Qu.  Median    Mean    3rd Qu.    Max.  
   5.00     25.00     40.00      52.32      60.00    450.00  

$`1 000 - 10 000`
   Min.   1st Qu.    Median    Mean    3rd Qu.    Max.
   5.00      25.00      45.00      62.01      75.00    450.00  

$`10 000-50 000`
   Min.     1st Qu.    Median    Mean   3rd Qu.    Max.  
  10.00       25.00      40.00      61.08    90.00     210.00  

$`более 50 000`
   Min. 1st Qu.    Median    Mean    3rd Qu.    Max.  
  10.00   36.25     72.50      105.30    147.50  350.00  

Крускал тест

оказался предсказуемо значимым
Kruskal-Wallis rank sum test

data:  q1$zp by q1$size
Kruskal-Wallis chi-squared = 32.949, df = 5, p-value = 3.851e-06

Результаты очевидно предсказуемы: в компаниях до 25 человек работают рекрутеры кадровых агентств, они и показывают крайне низкие результаты стартовых зарплат. Увеличение зарплат с увеличением компании объясняется тем, что бОльшего размера компании сосредоточены чаще в Москве (а в Москве зарплата больше), и в бОльших компаниях больше hr начальников.
Отсюда вопрос: как мы с вами можем вычленить влияние именно размера компании, а не тех факторов, что я перечислил?

ПыСы

Коллеги, опрос проводится на некоммерческой основе, у меня нет спонсоров, я трачу много своего времени, поэтому, если Вы захотите выразить мне благодарность за интересные результаты, вы можете перевести небольшую сумму мне на Яндекс кошелек (кликните по кнопке Перевести)

или сделать перевод на карту Сбербанка,
Номер карты 676 280 38 921 538 46 57 - укажите "за результаты исследования". 
Или просто покликайте на директ рекламу ниже на странице - у вас это отнимет несколько секунд, а мне принесет немного денег. 
спасибо! 

суббота, 20 августа 2016 г.

Бенчмарк зарплат HR по отраслям

Показываю результат нашего исследования Ключевые факторы текучести и удержания персонала (коллеги, пожалуйста, поучаствуйте! результаты вкуснючие).
На этот раз бенчмарк зарплат HR по отраслям.
Обращаю ваше внимание, что я показываю бенчмарк стартовых зарплат - зарплат, на которые приходили HR в компании.

Выборка

Всего собрал данные по 567 HR. Распределение по отраслям такое:
  • Банки - 117 респондентов;
  • IT - 79;
  • Ритейл - 140;
  • Оптовая торговля - 84;
  • Промышленность - 147.
Мало кажется? так принимайте участие в бенчмарке зарплат HR по отраслям.
Были представители других отраслей, но количество респондентов маловато, чтобы включать в общий отчет. Дам вам наводку, сколько HR по другим отраслям, чтобы вы позвали коллег к участию)
  • Строительство - 51;
  • Телеком - 39;
  • Фармацевтика - 31;
  • Транспорт - 29;
  • Энергетика - 23;
  • HoReCa - 20
Так что все шансы есть поучаствовать).
Стартовые зарплаты брались по 2010- 2016 годам. Кому-то покажется разбег не корректным, но если мы посмотрим бенчмарк зарплат HR по годам, то обнаружим, что нет у нас большого разброса годам.

Итак

Картинка получилась вот такая
Бенчмарк зарплат HR по отраслям

Дескриптивные статистики 

$Banks
   Min.  1st Qu.   Median      Mean   3rd Qu.    Max.  
  10.00   30.00       50.00      75.62      82.50    450.00    
$IT
   Min.    1st Qu.    Median       Mean   3rd Qu.    Max.  
   5.00       30.00      45.00       54.07      67.50     200.00  
$Retail
   Min.    1st Qu.    Median    Mean    3rd Qu.    Max.  
  10.00      25.00      40.00      59.39      80.00     250.00  
$Opt
   Min.    1st Qu.   Median      Mean    3rd Qu.    Max.  
  10.00      25.00      40.00       51.92      61.25     310.00  
$Manuf  (Промышленность)
   Min. 1st Qu.     Median    Mean    3rd Qu.      Max.
   5.00   20.00      35.00        53.61       60.00      450.00  

Крускал тест

Kruskal-Wallis rank sum test

data:  q7$zp by q7$otr
Kruskal-Wallis chi-squared = 10.81, df = 4, p-value = 0.02878
Ну, конечно, не так чтобы, но Банки и Промышленность дают значимые различия.

Самое интересное в этом результате, что Бенчмарк текучести HR по отраслям показывает другие результаты. Банки и Промышленность на разных полюсах.

Вопрос на засыпку

Как бы вы объяснили эти результаты?

ПыСы

Коллеги, опрос проводится на некоммерческой основе, у меня нет спонсоров, я трачу много своего времени, поэтому, если Вы захотите выразить мне благодарность за интересные результаты, вы можете перевести небольшую сумму мне на Яндекс кошелек (кликните по кнопке Перевести)

или сделать перевод на карту Сбербанка,
Номер карты 676 280 38 921 538 46 57 - укажите "за результаты исследования". 
Или просто покликайте на директ рекламу ниже на странице - у вас это отнимет несколько секунд, а мне принесет немного денег. 
спасибо! 

среда, 17 августа 2016 г.

Как в Python читать файлы формата excel



Иногда задача кажется бессмысленной, но все равно хочется ее решить: ведь совершенно просто файл формата .xlsx сохранить в формате .csv и не парить по поводу загрузки в Python для обработки.
Но раз уж попала вожжа под хвост, то покатимся. Это первая причина, а вторая причина - мои посты на 99 % носят содержательный характер, гуманитарный я бы сказал. Т.е. я показываю содержательное решение задачи, а где-нибудь в уголке показываю метод (с помощью xgboost). А сегодня под настроение хочется показать кусок кода.

Ну и так

давайте загрузим в Python такой файл
first
second
2
5
3
6
Загружаем сначала необходимые пакеты
import pandas as pd
import xlrd
За загрузку файла excel отвечает пакет xlrd, и загружается он напрямую, не через pip - мелочь, а приятно.
Загружаем
rb = xlrd.open_workbook('D:1.xlsx',formatting_info=False)
sheet = rb.sheet_by_index(0)
Далее вот такой хитрый код
row = []
for i in range(sheet.nrows):
    r = sheet.row_values(i)
    row.append(r)
print (row)
Данные у нас выходят в таком виде
[['first', 'second'], [2.0, 5.0], [3.0, 6.0]]

Нам это не нравится, мы переводим в табличный вид
df = pd.DataFrame(row)
df.columns = df.iloc[0]
df = df.reindex(df.index.drop(0))
Последние две строки для того, чтобы первая строка стала заголовками. Можно, видимо, сделать это элегантней.
Ну и как то так
first
second
1
2
5
2
3
6

Такой способ загрузки может быть востребован, если вы не хотите тратить время на переформатирование файла (чаще присылают excel, а не csv). И кроме того, при данном способе Python обрезает пустые строки сверху. Т.е. если вам прислали файл, в котором сверху отступ в виде пустых строк, то загрузятся только строки с данными

Пост показался полезным?

Кликните на директ рекламу - вы сэкономите время с помощью кода, а мое затраченное время будет не таким бессмысленным)))

Python и анализ данных

Python и анализ данныхБуду рассказывать про книги, которые я читаю и изучаю.
Начну с базовой "Python и анализ данных".
Книга для широкой аудитории, но я ее рекомендую в первую очередь тем, кто только собирается изучать Python.
Это по сути учебник с первых шагов: от установки и базовых шагов.
Python, наверное, стоит изучать в он - лайн режиме на курсах типа курсеры или edx.org, но книгу нужно иметь под рукой как справочник.
Достаточно сказать, что преподаватели курса "Введение в машинное обучение" от Высшей школы Экономики рекомендовали эту книгу как базовую.
А курс этот, если кто проходил - крышесносный)

"Python и анализ данных" выпущена издательством ДМК Пресс - обращаю ваше внимание на это издательство. Если вы развиваетесь в сфере аналитики, то книг данного издательства вам не миновать.
Когда я сидел на Rstudio, я пользовался теми же книгами ДМК Пресс. И если вы начинаете с R, то наверняка слышали про книгу R в действии. Анализ и визуализация данных на языке R или Наглядная статистика. Используем R!.
Там же вышел учебник по статистике от профессоров Стенфорда Хасти с командой, авторы очень популярного курса по статистике. Но я его на сайте издательства не нашел, подозреваю, что ушел влет.
Купить книгу "Python и анализ данных" можно на Озоне>> либо, как вариант, через сайт самого издательства.
Ну как-то так. Ждите продолжение серии.

понедельник, 15 августа 2016 г.

Статьи по hr аналитике на английском - 5

Очередная порция статей по hr-аналитике.
Выкладываю ссылку только на последнюю порцию статей Статьи по hr аналитике на английском - 4 - там вы найдете ссылки на все посты со статьями на английском.
Статьи на сегодня

  1. People Analytics Market Growth: Ten Things You Need to Know - статья Джоша Берзина. Джош повторяется, но вне зависимости, про что он пишет, его статьи надо хотя бы просматривать. 
  2. 20 People Analytics Case Studies - Part 1 - самая ценная статья в данном обзоре, пожалуй. Давид Грин показывает кейсы от западных компаний по hr -аналитике. Стоит ознакомиться как минимум с названиями компаний. И если в будущем вам будут говорить, что hr-аналитика не развита и все такое, можете привести в качестве примера эту статью. На сегодняшний день people analytics имеет уже целый набор кейсов, свою тусовку, методы и заходы. 
  3. 20 People Analytics Case Studies - Part 2 - тоже самое, часть 2.
  4. Reinventing School: 108 Ed Tech Startups Across Learning Management, Language Teaching, And More - может не совсем в тему hr-аналитики, но близко, поскольку а) про технологии и б) на указанных ресурсах также учат hr-аналитике. В статье собраны все ресурсы стар-апы по обучению.
  5. Why The Future Of Work Is All About The Employee Experience - статья тоже не совсем про аналитику, но часто цитируется западными аналитиками, в которой автор рассказывает про новую парадигму отношений работодатель - работник.
  6. The 5 most trending HR analytics articles of July 2016 - ну тут все понятно. Я бы рекомендовал осторожно относиться к подобным статьям, поскольку они чаще про около аналитику, а не аналитику.
  7. Exclusive: Google Names Eileen Naughton As New Head Of People Operations - может для кого то еще будет новостью: в Google сменился вице-президент по HR, Ласло Бок уходит. Посмотрите на нового, точнее новую
  8. Analysis of Trump on Twitter indicates he writes only the angry tweets - это не про HR-аналитику, но это про анализ текстом Трампа, и нас, HR, может заинтересовать сам анализ, те результаты, которые мы можем получать у себя на наших данных.
Статьи по hr аналитике на английском - 5

До встречи)

четверг, 11 августа 2016 г.

Как сочетание психотипов руководитель - подчиненный влияет на эффективность подчиненных



Я очень долго шел к этому посту: это и процесс дозревания как специалиста, и, что главнее, отсутствие данных. И если вы не звезобол от HR, а профи, который реально занимается данными, то вы меня поймете, как непросто было набрать такой внушительный датасет.

Заход на проблему

Проблема проста - прогноз эффективности кандидата. Вопрос в том, что во всех кейсах, что я встречал, прогнозируют эффективность на основе только показателей кандидата. Но при этом на уровне просто здравого смысла мы понимаем, что на эффективность должны влиять отношения в паре руководитель подчиненный. Я выделил курсивом, поскольку эта фраза не корректна для исследователя, но я решил обозначить некий здравый смысл.
То, что понятно на уровне здравого смысла, вытекает в технические проблемы:
  • что значит отношения руководитель - подчиненный?
  • и главное, как померить отношения?

Как я реализовал 

Я взял результаты личностных тестов подчиненного и руководителя. Поначалу я включил в уравнение прогноза данные тестов как отдельные переменные, результаты здесь Кейс по прогнозу эффективности работников.
Но опять: мы берем данные сингл - не в интеракции между собой.
Для интеракции я проделал следующую процедуру: провел кластеризацию (Kmeans) данных тестов руководителей и подчиненных, и получил несколько типов руководителей и подчиненных.
Интересно, что кластеры получились практически идентичные на выборке руководителей и на выборке подчиненных.

Про терминологию

Я вместо слова "кластер" буду использовать слово "психотип" только потому, что "психотип" более популярно, чем кластер. Но отнюдь не претендую на точность употребления термина.
Если вы мне подскажите, какой термин более соответствует "кластеру" в машинном обучении, буду вам благодарен
Показываю кусок визуализации психотипов


Как сочетание психотипов руководителя - подчиненный влияет на эффективность подчиненных


  • По оси X -шкалы теста, 
  • по оси Y - выраженность этого качества у того или иного психотипа.

Название теста, шкал не даю, поскольку это конфиденциальная информация, но немного удовлетворю ваше любопытство.
Второй психотип - это люди с высокой нормативностью, методичностью, умением выполнять рутинные операции, но низкими показателями по гибкости, креативности, уверенности в себе и мотивации достижения.
Почему второй психотип только описываю? Дальше

Есть ли любовь между психотипами

Параллельно проверил гипотезу: не притягивается ли подобное подобным? Руководители также выбирают себе подчиненных,  ия решил проверить через старый добрый Хи квадрат, не чаще ли руководители определенного психотипа выбирают себе подобных или другой психотип
Как сочетание психотипов руководителя - подчиненный влияет на эффективность подчиненных
На картинке показано сочетание психотипов руководитель - подчиненный ( не смотрите на нижнюю строку и крайнюю правую колонку - это итоги).
Частота распределения наводит на профессионалов на мысль, что связи между психотипами нет, а я еще скажу, что Хи квадрат равен - 0, 12, и мы констатируем, что руководители не имеют предпочтений в выборе себе определенного психотипа. Если не считать, что в целом предпочитают выбирать нулевой психотип, а это вполне себе объяснимо, поскольку специалисты данного психотипа имеют ярко выраженные навыки презентации и уверенности в себе.

Сочетание психотипов и эффективность

А далее я сделал хитрую штуку: я сметчил психотипы и получил новую переменную. Т.е. я использовал сочетание психотипов. И в итоге у нас в новой переменной было девять уровней (3 Х 3 сочетаний).
Регрессия (для спецов - xgboost) показало значимость сочетания второго и второго психотипов.
Результат: если подчиненный и руководитель это люди с высокой нормативностью, методичностью, умением выполнять рутинные операции, но низкими показателями по гибкости, креативности, уверенности в себе и мотивации достижения, то показатели подчиненного по эффективности в среднем значимо ниже, чем у других специалистов.
pvalue=0.0075
На этом наша радость может закончиться, поскольку я показываю данные


Как сочетание психотипов руководителя - подчиненный влияет на эффективность подчиненных
Здесь на боксплоте единицей обозначена группа сочетания психотипов "2" руководителей и подчиненных, а по оси Y - 5 выполнения KPI.
Заметили, что различие крайне незначительно?

Вот дескриптивные статистики

Показываю результаты эффективности выполнения KPI для сочетания психотипов "2" и остальных.
Для нулевой группы
   mean        1.134012
     std         0.178565
     min         0.530000
     25%         1.000000
     50%         1.090000
     75%         1.220000
     max         2.000000
Для сочетания психотипов 2 и 2
     mean        1.098419
     std         0.164190
     min         0.420000
     25%         1.000000
     50%         1.050000
     75%         1.170000
     max         1.760000
Правда, смешно? разница медиан 0, 04 выполнения KPI. 
Вопрос вам: вы бы подчиненного психотипа "2" отправили к руководителю психотипа "2", зная, что вместе они имеют риск выполнения KPI на четыре сотых меньше? 
На это кланяюсь, обещаю копать дальше

__________________________________________________________
На этом все, читайте нас в фейсбукетелеграмме и вконтакте


воскресенье, 7 августа 2016 г.

Еще раз про миф в оценке персонала



Пост - резюме обсуждения. Выложил недавно в сеть пост Главный миф в оценке персонала, в этом месте было бурное обсуждение поста.
Попробую кратко описать обсуждение и мои вопросы.
На Западе проводится мета-анализ методов оценки персонала, приведенные мной данные - устаревшие, на сегодня есть обновленные данные (или см. ниже картинку), где ассессмент центр опустился в точности, а тесты интеллекта выросли.
И вообще, показатели исследования - это не объясненная дисперсия, не коэффициент Пирсона, высчитывается по сложной формуле, поэтому мне не стоит сравнивать свои кейсы с данными цифрами.
Мои комменты и вопросы:

  • Пусть метаанализ предполагает более сложный коэффициент, но тогда было бы неплохо получить объяснение, что в практическом смысле этот коэффициент обозначает. Также, как мы понимаем R^2.
  • Ну хорошо, сам исследователь далеко, его не допросишься, но тех, кто активно продвигают и защищают такие исследования, можно попросить объяснить нам, какой практический смысл имеют цифры и коэффициенты исследования? И что на основе данного исследования может предпринять в своей конкретной компании вполне конкретный HR?
  • Пусть метаанализ предполагает более сложный коэффициент, чем, например, R^2, но сам коэффициент в границах от нуля до единицы, и HR воспринимает валидность как высокую и близкую к нулю, а реальные кейсы демонстрируют другие цифры, например здесь R^2 дает максимум 0, 25, что очень далеко до 0, 65 тестов интеллекта на картинке ниже, а в моем кейсе были не только тесты способностей, была куча других признаков. В итоге у HR могут возникнуть завышенные ожидания от инструментов оценки.
  • В уже указанном кейсе ассессмент центр вообще не присутствует, поскольку связь с эффективностью равна нулю. И мой опыт показывает: ассессмент центр во всех кейсах показал нулевую связь с эффективностью. Как бы не считался коэффициент мета анализа, но не натягивает на 0, 37. Ноль везде ноль.
  • Хорошо, мой опыт нельзя считать репрезентативным, а я сам ангажирован, зол на провайдеров ассессмент центра и все такое. Тогда давайте проведем консилиум. Найдите мне кейс реальной российской компании, где ассессмент центр показал бы связь с эффективностью. Только кейс должен содержать цифры и набор данных с описанием, а не просто рассказом, что вот мы сделали, а у нас продажи сразу раз и выросли на 56 %. Этот кейс можно обсудить на любой hr конференции, а я со своей стороны могу показать свои кейсы, покажу, как я провожу анализ. Хотя уверен, вы не согласитесь на это)))
Дополнительно отмечу только, что 11-е место в списке занимает "Средний балл успеваемости", но при этом уже несколько крупных компаний отказались от использования этого показателя при приеме: нет никакой связи между эффективностью и уровнем успеваемости.

Еще раз про миф в оценке персонала

И еще добавлю от себя про тренды в оценке персонала - как я себе вижу главный тренд в оценке персонала


__________________________________________________________
На этом все, читайте нас в фейсбукетелеграмме и вконтакте