Литмир - Электронная Библиотека

Можем ли мы сразу, еще до анализа имеющихся данных, сказать, что между двумя переменными существует корреляция? Если да, то на какой график рисунка 9.5 больше всего будет похожа эта корреляция? Построение такой зависимости — всегда мой первый шаг при регрессионном анализе, поскольку чаще всего корреляция (если она существует) бывает очевидной. В Excel это очень просто сделать: заполните два столбца числами (в данном случае — недели раскрутки шоу и пункты рейтинга), каждая пара данных соответствует одному ТВ-шоу. Просто выберите весь набор данных, щелкните в меню программы Excel по кнопке «график», выберите опцию «XY (Scatter)» («график разброса»), выполните остальные указания, и вы увидите такой же график, как на рисунке 9.6.

Как измерить все, что угодно [Оценка стоимости нематериального в бизнесе] - img_31

Похоже, что корреляция имеется, но насколько она тесная? Ответ на этот вопрос требует знания некоторых тонкостей. Но я не стану здесь объяснять, на чем основано регрессивное моделирование, а взамен просто расскажу, что нужно сделать в Excel.

В программе Excel для расчета корреляции можно просто использовать функцию «=correl()». Предположим, что данные о продолжительности рекламы и рейтингах содержатся соответственно в первых 28 строках столбцов А и В электронной таблицы. Вы написали бы: =correl(A1:A28, В1:В28). С нашими данными мы получим коэффициент корреляции примерно 0,7. Поэтому можно с уверенностью считать, что увеличение продолжительности рекламы нового шоу повысит его рейтинг. Теперь пора сосредоточиться на упрощении процесса производства шоу и увеличении времени, которое можно потратить на рекламу.

Другой способ проделать это в Excel — воспользоваться опцией «Regression Wizard» («Мастер регрессии») из «Data Analysis Toolpack» («Набор инструментов для анализа данных») (перемещение к этой опции в разных версиях Excel разное, поэтому воспользуйтесь опцией «Справка»). Мастер регрессии подскажет вам выбрать «Y range» («интервал Y») и «X range» («интервал X»). В нашем примере это, соответственно, рейтинг и реклама (в неделях). Мастер создаст таблицу с результатами регрессионного анализа. Некоторые из них поясняются в таблице 9.5.

На основе приведенной информации можно вывести формулу наилучшего приближения для связи между продолжительностью раскрутки и рейтингом шоу. Далее мы рассчитаем прогнозируемый рейтинг по числу недель рекламы. Удобно называть это значение (в данном случае прогнозируемый рейтинг) «зависимой» переменной, а величину, по которой она определяется, — «независимой».

Прогнозируемый рейтинг (пункты) = Переменная X 1 × Продолжительность раскрутки (недели) + Отрезок, отсекаемый на оси координат.

Если мы построим кривую, которую дает нам эта простая формула, на уже построенном нами графике, то он приобретет вид, представленный на рисунке 9.7.

Как измерить все, что угодно [Оценка стоимости нематериального в бизнесе] - img_32

Как измерить все, что угодно [Оценка стоимости нематериального в бизнесе] - img_33

Согласно рисунку 9.7, хотя корреляция и имеется, рейтинг зависит не только от продолжительности рекламы. Эта информация вместе с итогами управляемого эксперимента позволяет нам ответить на пресловутый вопрос: «Откуда мы это знаем, если есть и другие факторы?» Ясно, что длительность раскрутки имеет значение для рейтинга, и неважно, определены ли количественно эффекты от действия других факторов и даже выявлены ли они вообще.

Преимущество инструмента «Regression» («Регрессия») программы Excel над такими более простыми функциями, как =correl(), заключается в том, что он позволяет выполнять так называемую множественную регрессию. Таким образом, возникает возможность одновременно рассчитывать коэффициенты для нескольких независимых переменных. При желании мы могли бы создать модель, связывающую рейтинг не только с продолжительностью рекламы, но и со временем года, категорией шоу, откликами фокус-группы и несколькими другими факторами. В таблице 9.5 каждая из этих дополнительных переменных имела бы свой коэффициент «Переменная X2», «Переменная X 3» и т. д. В итоге мы получили бы следующую формулу:

Прогнозируемый рейтинг (пункты) = Переменная X 1 × Продолжительность раскрутки (недели) + Переменная X2 × Результаты фокус-группы +… + Отрезок, отсекаемый на оси координат.

Сказав все это, необходимо также сделать ряд предостережений. Во-первых, корреляция не означает причину. То, что одна переменная коррелирует с другой, не обязательно означает, что одна их них обусловливает другую. Церковные пожертвования и продажа алкоголя между собой коррелируют, но вовсе не потому, что между производителями алкоголя и духовенством есть какой-то сговор, а потому, что и то и другое зависит от состояния экономики. Как правило, чтобы утверждать, что между какими-то явлениями существует причинно-следственная связь, помимо наличия корреляции нужны дополнительные основания. В случае соотношения рейтинга и длительности рекламы такие основания у нас действительно есть.

Во-вторых, не забывайте о том, что это простые линейные регрессии. Взяв не саму переменную, а какую-нибудь ее функцию (например, ее квадрат, инверсию, произведение двух переменных и т. д.), можно рассчитать корреляцию еще точнее. При желании читатели могут с этим поэкспериментировать. Наконец, в моделях множественной регрессии вы должны следить за тем, чтобы независимые переменные не коррелировали друг с другом. В идеале между независимыми переменными не должно быть никакой связи.

Я лишь коснулся основ множественного регрессионного моделирования. Этот инструмент очень полезен, но пользоваться им необходимо с осторожностью.

Глава 10. Кое-что о Байесе

Простая байесовская статистика

Курс экономической статистики в первом семестре знакомит студентов с рядом методов, основанных на нескольких «делаемых для простоты» допущениях, хотя нередко эти допущения мало что упрощают. А в дальнейшем студенты узнают о таких более «продвинутых» методах, которые лично мне всегда казались более интуитивными, чем составляющие содержание предыдущих разделов.

Главное допущение, которое делается в большинстве вводных курсов статистики, заключается в следующем: единственное, что вы знаете о некоей генеральной совокупности, — это образцы, которые вы собираетесь из нее выбрать. Но на практике это допущение почти всегда неверно.

Предположим, что вы отбираете несколько торговых представителей для опроса на тему, существует ли связь между произошедшим недавно ростом продаж и проведенной ранее рекламной кампанией. Вы хотите оценить «вклад рекламной кампании в объем продаж». Для этого можно просто опросить весь торговый персонал. Но ведь изначально вы знаете больше, чем то, что расскажут вам эти люди. Вам и до опроса было кое-что известно о прошлой динамике продаж и об эффекте, который давали рекламные компании. Вы имеете сведения о сезонных колебаниях объема сбыта, влиянии экономического цикла и роли мер по повышению доверия потребителей. Имеет ли это какое-либо значение? Интуитивно мы понимаем, что предварительные данные также должны учитываться. Но пока студенты не доберутся до последних разделов своего учебника, им так и не расскажут, что нужно делать с этим знанием.

ПАРАДОКС ПРЕДВАРИТЕЛЬНОГО ЗНАНИЯ

1. Вся традиционная статистика исходит из того, что наблюдатель ранее не располагал никакой информацией об объекте наблюдения.

2. В реальном мире данное допущение почти никогда не выполняется.

Проблему прежних знаний изучает так называемая байесовская статистика. Автор этого метода — Томас Байес, британский математик и пресвитерианский священник XVIII века, самые известные работы по статистике которого были опубликованы только после его смерти. Байесовская статистика занимается вопросом: как мы корректируем свое предварительное знание с учетом новой информации? Байесовский анализ начинается с того, что известно сейчас, и затем рассматривает, как это знание изменится с получением новых сведений. А небайесовская статистика, преподаваемая в большинстве курсов по методам выборочного наблюдения, исходит из следующего: все, что известно о некоей группе объектов, — это выборка, которую вы только что из нее сделали.

45
{"b":"966525","o":1}