Надежность и валидность теста - это что такое? Валидность в психологии.

К числу основных критериев оценки психодиагностических методик относится надёжность и валидность. Большой вклад в разработку этих понятии внесли зарубежные психологи (А. Анастази, Е. Гизелли, Дж. Гилфорд, Л. Кронбах, Р. Торндайк и Е. Хаген и др.). Ими были разработаны как формально-логический, так и математико-статистический аппарат (прежде всего корреляционный метод и фактический анализ) обоснования степени соответствия методик отмеченным критериям. В психодиагностике проблемы надёжности и валидности методик тесно взаимосвязаны, тем не менее, существует традиция раздельного изложения этих важнейших характеристик. Следуя ей, начнём с рассмотрения надёжности методик.

НАДЁЖНОСТЬ

В традиционной тестологии термин "надёжность " означает относительное постоянство, устойчивость, согласованность результатов теста при первичном и повторном его применении на одних и тех же испытуемых. надёжность методики - это такой критерий, который говорит о точности психологических измерений, т.е. позволяет судить о том, насколько внушают доверие полученные результаты.

Важной проблемой практической диагностики является выяснение негативных факторов, влияющих на точность измерений:

1. нестабильность диагностируемого свойства;

2. несовершенство диагностических методик

3. меняющаяся ситуация обследования

4. различия в манере поведения экспериментатора

5. колебания в функциональном состоянии испытуемого

6. элементы субъективности в способах оценки и интерпретации результатов

Разновидностей надёжности методик так же много, как и условий, влияющих на результаты диагностических испытаний.

Так как все виды надёжности отражают степень согласованности двух независимо полученных рядов показателей, то математико-статистический приём, с помощью которого устанавливается надёжность методики, - это корреляции (по Пирсону или Спирмену, см гл. XIV). Надёжность тем выше, чем больше полученный коэффициент корреляции приближается к единице, и наоборот.

основной упор делается на работы К.М. Гуревича (1969, 1975, 1977, 1979), который, проведя тщательный анализ зарубежной литературы по этой проблеме, предложил толковать надёжность как:

1. надёжность самого измерительного инструмента,

2. стабильность изучаемого признака;

3. константность, т.е. относительную независимость результатов от личности экспериментатора.

Показатель, характеризующий измерительный инструмент, предлагается называть коэффициентом надёжности, показатель, характеризующий стабильность измеряемого свойства, - коэффициентом стабильности; а показатель оценки влияния личности экспериментатора - коэффициентом константности.

ВАЛИДНОСТЬ

Валидность по своей сути - это комплексная характеристика, включающая, с одной стороны, сведения о том, пригодна ли методика для измерения того, для чего она была создана, а с другой стороны, какова ее действенность, эффективность. Проверка валидности методики называется валидизациеи.

Валидность в первом ее понимании имеет отношение к самой методике, т.е. это валидность измерительного инструмента. Такая проверка называется теоретической валидизациеи. Валидность во втором понимании уже относится не столько к методике, сколько к цели ее использования. Это прагматическая валидизация. Итак, при теоретической валидизации исследователя интересует само свойство, измеряемое методикой. Это, по существу, означает, что проводится собственно психологическая валидизация. При прагматической валидизации суть предмета измерения (психологического свойства) оказывается вне поля зрения.

что тест измеряет:

1. методика признавалась валидной, так как то, что она измеряет, просто "очевидно";

2. доказательство валидности основывалось на уверенности исследователя в том, что его метод позволяет "понять испытуемого";

3. методика рассматривалась как валидная (т.е. принималось утверждение, что такой-то тест измеряет такое-то качество) только потому, что теория, на основании которой строилась методика, "очень хорошая".

Провести теоретическую валидизацию методики - это показать, действительно ли методика измеряет именно то свойство, качество, которое она, по замыслу исследователя, должна измерять. Доказывается не только путём сопоставления с родственными показателями, а также и с теми, где исходя из гипотезы значимых связей не должно быть. Таким образом, для проверки теоретической валидности важно, с одной стороны, установить степень связи с родственной методикой (конвергентная валидность) и отсутствие этой связи с методиками, имеющими другое теоретическое основание (дискриминантная валидность).

Для проведения прагматической валидизации методики, т.е. для оценки ее эффективности, действенности, практической значимости, обычно используется независимый внешний критерий - показатель проявления изучаемого свойства в повседневной жизни. Таким критерием может быть успеваемость (для тестов способностей к обучению, тестов достижений, тестов интеллекта), производственные достижения (для методик профессиональной направленности), эффективность реальной деятельности - рисования, моделирования и т.д. (для тестов специальных способностей), субъективные оценки (для тестов личности).

Американские исследователи Тиффин и Маккормик (1968), проведя анализ используемых для доказательства валидности внешних критериев, выделяют четыре их типа:

1) критерии исполнения (в их число могут входить такие, как количество выполненной работы, успеваемость, время, затраченное на обучение и т.п.);

2) субъективные критерии (обычно субъективные критерии получают с помощью интервью, опросников, анкет);

3) физиологические критерии (замеряется частота пульса, давление крови, электросопротивление кожи, симптомы утомления и т.д.);

4) критерии случайностей (применяются, когда цель исследования касается, например, проблемы отбора для работы таких лиц, которые менее подвержены несчастным случаям).

Оценка валидности методики может носить количественный и качественный характер.

№ 19 Виды валидности. Измерение валидности

Вопрос о валидности до последнего времени представляется одним из самых сложных. Наиболее укоренившимся определением этого понятия является то, которое приведено в книге А. Анастази: «Валидность теста - понятие, указывающее нам, что тест измеряет и насколько хорошо он это делает»

Валидность по своей сути - это комплексная характеристика, вклю­чающая, с одной стороны, сведения о том, пригодна ли методика для измерения того, для чего она была создана, а с другой стороны, какова ее действенность, эффективность, практическая полезность.

По этой причине не существует какого-то единого универсального подхода к определению валидности. В зависимости от того, какую сто­рону валидности хочет рассмотреть исследователь, используются и разные способы доказательства. Другими словами, понятие валидно­сти включает в себя разные ее виды, имеющие свой особый смысл. Проверка валидности методики называется валидизацией.

Очевидная валидность - описывает представление о тесте, сложившееся у испытуемого. Тест должен восприниматься обследуемым как серьезный инструмент познания его личности, чем-то схожий с вызывающим уважение и в какой-то мере трепет медицинским диагностическим инструментарием. Очевидная валидность приобретает особое значение в современных условиях, когда представление о тестах в общественном сознании формируется многочисленными публикациями в популярных газетах и журналах того, что можно назвать квазитестами, с по- мощью которых читателю предлагается определить все, что угодно: от интеллекта до совместимости с будущим супругом.

Конкурентная валидность оценивается по корреляции разработанного теста с другими, валидность которых относительно измеряемого параметра установлена. П. Клайн отмечает, что данные о конкурентной валидности полезны тогда, когда есть неудовлетворительно работающие тесты для измерения некоторых переменных, а новые создаются для того, чтобы улучшить качество измерения. В самом деле, если уже существует эффективный тест, то для чего нужен такой же новый?

Прогностическая валидность устанавливается с помощью корреляции между показателями теста и некоторым критерием, характеризующим измеряемое свойство, но в более позднее время. Например, прогностическая валидность какого- либо теста интеллекта может быть показана корреляцией его показателей, полученных у испытуемого в возрасте 10 лет, с академической успеваемостью в период окончания средней школы. Л. Кронбах считает прогностическую валидность наиболее убедительным доказательством того, что тест измеряет именно то, для чего он был предназначен. Основная проблема, с которой сталкивается исследователь, пытающийся установить прогностическую валидность своего теста, состоит в выборе внешнего критерия. В особенной степени чаще всего это касается измерения личностных переменных, где подбор внешнего критерия - чрезвычайно сложная задача, решение которой требует немалой изобретательности. Несколько проще обстоит дело при определении внешнего критерия для когнитивных тестов, однако и в этом случае исследователю приходится «закрывать глаза» на многие проблемы. Так, академическая успеваемость традиционно используется в качестве внешнего критерия при валидизации тестов интеллекта, но в то же время хорошо известно, что успехи в обучении далеко не единственное свидетельство высокого интеллекта.

Инкрементная валидность имеет ограниченное значение и относится к случаю, когда один тест из батареи тестов может иметь низкую корреляцию с критерием, но не перекрываться другими тестами из этой батареи. В этом случае данный тест обладает инкрементной валидностью. Это может быть полезно при проведении профотбора с помощью психологических тестов.

Дифференциальная валидность может быть проиллюстрирована на примере тестов интересов. Тесты интересов обычно коррелируют с академической успеваемостью, но по-разному для разных дисциплин. Значение дифференциальной валидности, так же как и инкрементной, ограничено.

Содержательная валидность определяется через подтверждение того, что задания теста отражают все аспекты изучаемой области поведения. Обычно она определяется у тестов достижений (смысл измеряемого параметра полностью ясен!), которые, как уже указывалось, тестами собственно психологическими не являются. На практике для определения содержательной валидности подбираются эксперты, которые указывают, какая область (области) поведения наиболее важна, например, для музыкальных способностей, а затем, исходя из этого, генерируются задания теста, которые вновь оценивают эксперты.

Конструктная валидность теста демонстрируется полным, насколько это возможно, описанием переменной, для измерения которой предназначается тест. По сути дела, конструктная валидность включает в себя все подходы к определению валидности, которые были перечислены выше. Кронбах и Мил (Cronbach & Meehl,1955), которые ввели в психодиагностику понятие конструктной валидности, пытались решить проблему отбора критериев при валидизации теста. Они подчеркивали, что во многих случаях ни один отдельно взятый критерий не может служить для валидизации отдельного теста. Можно считать, что решение вопроса о конструктной валидности теста представляет собой поиск ответа на два вопроса:

1) существует ли реально некоторое свойство; 2) надежно ли измеряет данный тест индивидуальные различия по этому свойству. Вполне понятно, что с конструктной валидностью связана проблема объективности в интерпретации результатов по изучению конструктной валидности, однако эта проблема общепсихологическая и выходит за рамки валидности.

Не существует какого-либо единичного показателя, с помощью которого устанавливается валидность психологического теста. В отличие от показателей надежности и дискриминативности, нельзя осуществить точные статистические расчеты, подтверждающие валидность методики. Тем не менее разработчик должен представить весомые доказательства в пользу валидности теста, что потребует от него психологических знаний и интуиции.

валидность ≤ надежность.

Это означает, что валидность теста не может превышать его надеж­ность.

Данное соотношение, однако, неверно трактовать как указание на прямую пропорциональную связь валидности и надежности. По­вышение надежности отнюдь не обязательно приводит к повышению валидности. В терминах А. Анастази валидность определяется ре­презентативностью теста относительно измеряемой области поведе­ния. Если эта область поведения складывается из разнообразных фе­номенов, то содержательная валидность теста автоматически требует представленности в нем моделей всех этих разнообразных феноме­нов. Возьмем глобальное понятие «речевая способность» (этому психолингвистическому термину в традиционной тестологии соответству­ет термин «вербальный интеллект»). Сюда относятся такие относи­тельно независимые друг от друга навыки, как навыки письма и чте­ния. Если заботиться о содержательной валидности соответствую­щего теста, то нужно ввести в него группы заданий на проверку этих довольно разных по своему операциональному составу компонентов вербального интеллекта. Вводя разнородные пункты и субшкалы (суб­тесты), мы обязательно сокращаем внутреннюю согласованность, од­номоментную надежность теста, но зато добиваемся существенного повышения валидности. Таким образом, для расширения области при­менения теста психодиагност должен избегать излишнего повыше­ния внутренней согласованности. Одновременно с этим снижением внутренних корреляций между различными пунктами теста обязательно исчезает отрицательный эксцесс на кривой распределения тестовых баллов, и она все более приближается по форме к нормальной кривой.

Эмпирическая валидность. Если в случае с содержательной валидностью оценка теста производится за счет экспертов (устанавли­вающих соответствие заданий теста содержанию предмета измере­ния), то эмпирическая валидность измеряется всегда с помощью ста­тистического коррелирования: подсчитывается корреляция двух ря­дов значений - баллов по тесту и показателей по внешнему параметру, избранному в качестве критерия валидности.

Прагматические традиции западной тестологии привязывали эм­пирическую валидность теста к внешним для психологии социально-прагматическим критериям. Эти критерии являются показателями, обладающими непосредственной ценностью для определенных об­ластей практики. Практика всегда имеет целью либо повысить, либо понизить эти показатели. Например, в области педагогической пси­хологии это «успеваемость» (которую надо повысить), в психологии труда это «производительность труда» и «текучесть кадров», в меди­цине - «состояние здоровья пациента». Ориентируясь непосредственно на эти категории, психолог, пы­тающийся скоррелировать результаты теста с этими показателями, фактически решает сразу две задачи: задачу измерения валидности и задачу измерения практической эффективности своей психодиагнос­тической программы. Если получен значимый коэффициент корреля­ции, то можно считать, что решены с позитивным результатом сразу обе эти задачи. Но если корреляции не обнаружено, то остается нео­пределенность: либо невалидна сама процедура (тестовый балл не отражает, например, стрессоустойчивость оператора), либо неверна гипотеза о наличии причинно-следственной связи между психичес­ким свойством и социально значимым показателем (стрессоустойчивость не влияет на процент аварийных ситуаций).

Таким образом, социально-прагматические критерии являются комплексными: они позволяют измерить валидность-эффективность, но не каждое из этих двух свойств теста отдельно. На практике пси­холога часто ожидает и еще более сложная ситуация, когда заказчик требует от психолога на основании полученного диагноза сразу же определенных мер по вмешательству в ситуацию (отбор, консульти­рование, обучение и т. п.). В этом случае повышение показателей (достоверное по сравнению с контрольной группой) доказывает од­новременно и валидность-эффективность диагностики, и эффектив­ность самого вмешательства. А отрицательный результат дает еще большую неопределенность, так как оказывается невозможным от­делить неэффективность вмешательства от низкой валидности ди­агностики.

Процедура эмпирической валидизации. Организация выборки при эмпирической валидизации зависит от временного статуса критерия. Если этот критерий - событие в прошлом (ретроспективная валидизация), то к участию в психодиагностическом обследовании доста­точно привлечь только тех испытуемых, которые оказались на экстремальных полюсах по этому критерию. В результате применяется ме­тод экстремальных (контрастных) групп. Коррелирование с суммар­ным баллом по тесту оценивается с помощью бисериального коэф­фициента по формуле.

Если критерий - будущее событие (проспективная валидизация), то выборка должна быть составлена с запасом - с учетом вероятного объема экстремальных групп в будущем. Например, нужно выяснить, позволяет ли диагностика темперамента прогнозировать повышен­ный риск психосоматических заболеваний (гипертония, язва, астма и т. п.). Пусть на основании эпидемиологических исследований извес­тно, что в течение трех лет из. 1000 здоровых людей этими болезнями заболевают 57 человек. Это означает, что превентивной (предупреж­дающей) диагностикой должно быть охвачено около 2000 человек, чтобы получить численность «высокой» группы (заболевших) поряд­ка 100 человек. Проспективная валидизация выявляет прогностичес­кую эффективность диагностической процедуры. Высокая прогнос­тическая валидность доказывает как валидность самого измерения, так и наличие предполагаемой причинной связи.

№ 20 Достоверность как специальная разновидность валидности применительно к тестовым самоотчетам. Методы борьбы с социальной желательностью.

Особой разновидностью валидности является ДОСТОВЕРНОСТЬ. Речь идет о сознательных или бессознательных искажениях, которые вносит в тестовые результаты сам испытуемый, руководствуясь в ходе теста особой мотивацией, отличающейся от той, которая присуща ему в реальном поведении. Способность теста защищать информацию от МОТИВАЦИОННЫХ ИСКАЖЕНИЙ и есть достоверность теста. Особенно, остро проблема достоверности стоит в случае тест-опросников, которые допускают больше свободы в выборе испытуемым любого варианта ответа. Типичный прием обеспечения достоверности - наличие в тест-опросниках ШКАЛ ЛЖИ, введение вопросов «не про что», введение параллельных вопросов, вопросов дублей. Эти шкалы основываются главным образом на феномене СОЦИАЛЬНОЙ ЖЕЛАТЕЛЬНОСТИ - стремлении испытуемых давать в ходе тестирования социально одобряемую информацию. Если испытуемый набрал по шкале лжи балл выше критического, то его протокол объявляется недостоверным и ему предлагается либо выполнить данный тест еще раз более откровенно, либо выполнить другой тест. Многие более специфичные ловушки, направленные на измерение достоверности, часто входят как компонент в структуру конкретного теста, а иногда даже не подлежат разглашению как элемент ноу-хау (информационного изобретения) и профессиональной тайны, разделяемой разработчиками только с лицензированными пользователями методики, подписавшими особое лицензионное соглашение при приобретении теста. Достоверность тестирования тесно связана со степенью доверительности общения, которую смог психолог установить с данным испытуемым. Здесь полезно различать две диагностические ситуации: консультативную (СИТУАЦИЯ КЛИЕНТА) и аттестационную (СИТУАЦИЯ ЭКСПЕРТИЗЫ). В первом случае испытуемый участвует в тестировании на добровольной основе и сам заинтересован получить рекомендации по результатам тестирования (как, например, в профориентационной консультации). Во втором случае тестирование проводится по инициативе педагога или администрации, психолога, родителей, т. е. других лиц, и эти другие больше заинтересованы в результатах, чем сам испытуемый. Понятно, что в аттестационной ситуации вопрос о достоверности особенно актуален. И опросники, не снабженные шкалами лжи, использовать в таких ситуациях бесполезно. Наоборот, в ситуации клиента могут быть использованы такие методики, на которые испытуемый заведомо будет отвечать некорректно в ситуации экспертизы. Вопросы достоверности и стандартизации тесно связаны между собой. Очень часто даже объективные тесты достижений, если они проходили стандартизацию на добровольцах (в ситуации консультации), должны быть рестандартизированы ля того, чтобы их использовали в аттестационной ситуации.


№ 21 Технология создания и адаптации методик

Создание оригинальной методики или адаптация зарубежной ме­тодики не могут сводиться только к проверке (или перепроверке) от­дельных психометрических свойств - репрезентативности, надежно­сти, валидности, достоверности - в произвольной последовательнос­ти. В одних случаях целесообразно начинать с одного этапа работы, в других - с другого. В действительности любая реальная ситуация использования те­ста не является ситуацией только «конструирования» или только «применения». Можно без преувеличения сказать, что существует конти­нуум между крайними полюсами:

«конструирование» __________________ «применение»

и каждая ситуация до определенной ступени удалена от обоих полю­сов. Трудно назвать такой случай, когда бы конструирование совер­шенно нового теста начиналось с нуля, «на пустом месте». Также труд­но найти и такие случаи, когда все аспекты тестирования были бы полностью неизменными и воспроизводили бы уже совершенно ис­следованную нормативную ситуацию применения готового теста. Но все это многообразие ситуаций, всю комбинаторику независи­мых параметров психологи-практики, как правило, пытаются свести к двум-трем типовым ситуациям.

1. Ситуация применения. Тест кем-то разработан (возможно, В: других социокультурных условиях), известны тестовые нормы, полу­ченные на представителях данной языковой культуры (несоответствие выборки стандартизации и выборки применения по половозрастной структуре и профессионально-культурным признакам признается не­существенным).

2. Ситуация адаптации. Тест кем-то разработан – проверены на­дежность и валидность, но отсутствуют тестовые нормы (как правило, отсутствуют вообще для любых представителей данной языковой культуры). Задача адаптации сводится, таким образом, к построению тестовых норм.

3. Ситуация конструирования. Есть концепция психического свой­ства, но нет процедуры его измерения, удовлетворяющей требованиям места, времени, возможностям количественного анализа и ограничениям прочих ресурсов. Надо придумать измерительную процедуру, проверить ее надежность и валидность, построить тестовые нормы.

Остановимся прежде всего на вопросах адаптации так называе­мых переводных тестов. Путь быстрого пополнения репертуара ме­тодик за счет множества готовых зарубежных методик кажется мно­гим психологам наиболее экономичным, кратчайшим путем к надеж­ной и валидной психодиагностике. Но ведь если при этом адаптация сводится только к построению нормативного распределения тесто­вых баллов, то это означает, что валидность и надежность адаптированной методики в новых условиях принимаются на веру, а теорети­ческая концепция автора теста и содержание использованных им критериев валидности просто переносятся в наши условия без измене­ний (ведь для любой, в том числе и для невалидной и ненадежной методики, можно получить распределение). Подобный перенос дает пренебрежимые погрешности только для тестирования относительно элементарных психических свойств (та­ких, как свойства нервной системы, функциональные состояния, сенсомоторные параметры, элементарные когнитивные функции, при­чем с использованием объективных процедур (психофизиологичес­кая регистрация, тесты с «физическими» критериями успеха и т. п.). При тестировании интегральных психических свойств личности и индивидуального сознания (черты, мотивы, установки, самооценка, общие способности, стиль общения, ценностные ориентации, инте­ресы и т. п.), а также при употреблении любых лингвистических средств в самой процедуре тестирования (включая не только форму­лировки задач, вопросов; но и исходную формулировку инструкции к тесту) и использовании культурно-специфических критериев оценки правильности результата (определения шкального ключа) ограничи­ваться только сбором тестовых норм при адаптации - недопустимо!

Требуется серьезная эмпирическая работа по проверке надежно­сти и валидности в новых социокультурных условиях, работа, факти­чески соответствующая по своему объему созданию оригинальной методики. С этой точки зрения, заимствование зарубежных общедиаг­ностических тестов способностей, черт характера, интересов и т. п. вовсе не оказывается кратчайшим путем к психодиагностике. Этот путь кажется короче только тем, кто сознательно или по неведению пренебрегает принципами психометрики.

Перечислим необходимые этапы эмпирико-статистической рабо­ты при адаптации многомерного переводного тест-опросника.

1. Анализ внутренней валидности, внутренней согласованности пунктов, из которых состоит тест-опросник. Этот анализ призван по­казать, что существует некое (еще неясно, какое именно) общее диаг­ностическое свойство, лежащее на пересечении всех эмпирических индикаторов (в центре «пучка» скоррелированных пунктов-векторов). Такой анализ обязателен по отношению ко всем тестовым шкалам, полученным с помощью факторного анализа, например к тест-опросникам EPI Айзенка и 16PF Кеттелла. А вот к опроснику «локус конт­роля» или ко многим основным клиническим шкалам MMPI требова­ние внутренней согласованности применять не обязательно, так как пункты в эти шкалы подбирались по внешнему критерию и не связа­ны в один «пучок». Анализ внутренней согласованности может быть применен и к одномерным, и к многомерным тестам. В первом слу­чае достаточно иметь настольный калькулятор. Для многомерных те­стов необходимо использование специальной компьютерной програм­мы «Анализ пунктов».

2. Проверка устойчивости к перетестированию. Эта проверка со­вершенно необходима при диагностике свойств, по отношению к ко­торым теоретически ожидается инвариантность во времени. Анализ ретестовой надежности может быть (так же как анализ надежности согласованности) совмещен с исследованием информативности от­дельных пунктов теста, а также, возможно, и устойчивости отдель­ных пунктов. Без сведений о ретестовой надежности психолог не имеет права использовать тест для построения любого элементарного статического экстраполирующего прогноза.

3. Анализ корреляций с релевантным внешним критерием. Этот этап адаптации совершенно необходим, если тест разрабатывался из­начально как критериально-ориентированный, т. е. отбор пунктов производился на основании их корреляций с каким-то критерием валидности. Например, подобная работа проделана коллективом Ф. Б. Березина для сокращенной модифицированной версии MMPI (Березин Ф. Б. и др., 1976).

4. Проверка или рестандартизация тестовых норм. Об этом этапе уже говорилось выше. К сожалению, только этот этап работы по адап­тации тестов до недавнего времени признавался всеми психолога­ми как необходимый. Но и в этом случае далеко не всегда воспроиз­водилась необходимая статистическая работа по проверке устойчи­вости полученного распределения тестовых баллов к расщеплению выборки.

5. Специфичный этап для многомерных тестов - проверка вос­производимости структуры отношений между шкалами. Например, для теста Айзенка принципиальна ортогональность, статистическая независимость факторов «экстраверсия - интроверсия» и «нейротизм - стабильность». На воспроизводимости структуры связей шкал между факторами 16PF основывается корректность подсчета вторич­ных факторов (Ямпольский Л. Г., 1981; Мельников В. М., Ямпольский Л. Г., 1985).

Даже беглый взгляд на пять перечисленных этапов позволяет убе­диться в том, что адаптация зарубежных тестов мало чем уступает по объему эмпирико-статистической работы созданию оригинальных ме­тодик. Здесь было бы даже более адекватным использование не тер­мина «адаптация», а выражения «исследование зарубежной методики на отечественной выборке».

№22 Требования к психометрической подготовке психолога

Для эффективного развития практической психодиагностики сегодня требуется резкое повышение психометрической культуры всех психологов, использующих измерительные психодиагности­ческие методики. Методами рестандартизации теста, простейши­ми приемами проверки надежности и валидности должны владеть все психологи.

До сего дня сохранилось не вполне оправданное разделение (и даже противопоставление) психологов, считающих себя специалис­тами в области клинических методов, и психологов, считающих себя специалистами по тестированию. Но в большинстве реальных прак­тических ситуаций требуется сочетание этих методов. Клинические, диалогические методы необходимы на начальных этапах работы в заданной области для того, чтобы психолог сумел построить ясное содержательное представление о предмете психодиагностики. Они также необходимы в особых спорных случаях, требующих индивиду­ализированного подхода. Но когда от психолога требуется проведе­ние ускоренных, массовых обследований, обращение к некоторым стандартизованным, измерительным методикам становится неизбеж­ным. Здесь требуется психометрическая грамотность в подборе тако­го рода методик: нельзя использовать методики, о которых неизвест­но, какого рода психометрической отладке они подвергались.

Всеобщая психометрическая грамотность психологов не исклю­чает выделения из их среды специалистов особого рода - психологов-психометристов, профессионально занимающихся психометри­ческим обеспечением психодиагностики. Поэтому целесообразно привести здесь два списка нормативных требований - к психологу и к психологу-психометристу.

Требования к психологу:

1. Психолог должен уметь квалифицированно разбираться с пси­хометрической документацией в методической литературе по психо­диагностике, должен знать, какие психометрические характеристики теста должны указать его разработчики, в какой степени эти психо­метрические характеристики соответствуют типу теста, с одной сто­роны, и актуальной задаче, для которой его требуется использовать, с другой. Например, в тех случаях, когда требуется использовать тест для прогноза со значительным упреждением, а сведений о проверке прогностической валидности не получено, тест не может считаться готовым для решения данной задачи.

2. Психолог должен правильно определить, в какой мере извест­ные тестовые нормы по требующейся методике применимы в его си­туации с учетом контингента испытуемых и типа диагностической си­туации, существует ли ситуация «внутрикультурного переноса» и нуж­на ли рестандартизация тестовых норм. При необходимости психолог должен уметь самостоятельно практически произвести рестандартизацию, построив и проанализировав распределение тестовых баллов.

3. Психолог должен уметь самостоятельно собирать данные, прово­дить корреляционную обработку и измерять эмпирическую валидность эффективность методики по отношению к заданному критерию. При необходимости психолог должен уметь самостоятельно конкретизиро­вать операциональные индикаторы критериальной информации.

4. Психолог должен уметь самостоятельно определять появление слишком высокой погрешности в результатах, утрату методикой не­обходимого уровня надежности, при этом проверять свою гипотезу статистически.

5. Психолог обязан вести двойную документацию: все копии про­токолов он должен быть готов передать в головную методическую организацию (научно-академическую или отраслевую) для пополне­ния общего банка данных и совершенствования психометрических характеристик методики. Все модификации, вносимые в методику (формулировку инструкции, отдельных вопросов, последовательность предъявления), психолог должен согласовывать с головной методи­ческой организацией, так как самодеятельное введение на местах раз­нообразных частных модификаций влечет за собой утрату психомет­рической чистоты получаемых результатов, не ускоряет, а замедляет создание модификаций, адаптированных к специфическим условиям и обладающих необходимыми психометрическими свойствами. Тща­тельное соблюдение заданных методических стандартов - необходи­мый атрибут психометрической культуры психолога.

6. Психолог должен уметь самостоятельно выявлять и измерять уровень мотивационных искажений, обусловливающих фальсифика­цию тестовых данных испытуемыми, должен уметь корректно отсеи­вать недостоверные протоколы, статистически фиксировать достиже­ние приемлемого уровня достоверности для массовых результатов в групповой психодиагностике.

7. Психолог должен овладевать приемами сложного количествен­ного подсчета косвенных тестовых показателей, а также интегральных показателей, требующих агрегирования многообразной числовой ин­формации. Он должен уметь поставить задачу программисту (или психологу-психометристу) для проведения расчетов на компьютере.

Психолог-психометрист должен уметь:

1. Самостоятельно планировать и осуществлять все этапы по пси­хометрическому конструированию или адаптации психодиагностичес­ких методик: проверку надежности и валидности на уровне отдель­ных пунктов теста, отсев ненадежных и невалидных пунктов, пост­роение и анализ распределения тестовых баллов, составление мате­матических уравнений для прогнозирования или «решающего правила» для распознавания.

2. Организовывать хранение и обработку психодиагностических данных на компьютере, владеть навыками работы на компьютере в рамках стандартных операционных систем, знать структуру исполь­зуемых в психодиагностике баз данных и уметь управлять базами дан­ных.

3. Организовать работу психологов-психодиагностов по ведению документации к используемым методикам, по соблюдению методи­ческих стандартов, по сведению и интеграции результатов в общие банки психодиагностической информации.

4. Вести картотеку методик в рамках заданной области (отрасле­вой психологической службы), тщательно иерархизируя методики по уровню психометрической обеспеченности, вести библиотеку мето­дических материалов и методических рекомендаций по использова­нию стандартизованных методик.

№23 Психодиагностические ситуации и задачи

Психодиагностические задачи можно различать с точки зрения того, кто и как будет использовать диагностические данные и какова ответственность психодиагноста в выборе способов вмешательства в ситуацию обследуемого.

· Данные используются специалистом-смежником для постановки непсихологического диагноза или формулирования административного решения. Эта ситуация типична для использования психодиагностических данных в рамках деятельности различных комиссий (административной, аттестационной, дисциплинарной). Психолог выносит суждение о специфических особенностях мышления, личности сотрудника, а руководство учреждения принимает решение, за которое психолог не несёт персональную ответственность. В данном случае психолог выступает в качестве эксперта, давая свою оценку наряду с прочими участниками. Он должен следить за тем, чтобы характер использования результатов не выходил за рамки, очерченные требованиями профессиональной этики. С этой целью документ, который готовит психолог для заказчика, должен содержать информацию об ограничениях в использовании результатов.


©2015-2019 сайт
Все права принадлежать их авторам. Данный сайт не претендует на авторства, а предоставляет бесплатное использование.
Дата создания страницы: 2016-02-12

Прежде чем психодиагностические методики могут быть использованы для практических целей, они должны пройти проверку по ряду формальных критериев, доказывающих их высокое качество и эффективность.

К числу основных критериев оценки психодиагностических методик относятся надежность и валидность. Большой вклад в разработку этих понятий внесли зарубежные психологи (А. Анастази, Е. Гизелли, Дж. Гилфорд, Л. Кронбах, Р. Торндайк и Е. Хаген и др.). Ими были разработаны как формально-логический, так и математико-статистический аппарат (прежде всего, корреляционный метод и факторный анализ) обоснования степени соответствия методик отмеченным критериям.

Валидность – это комплексная характеристика, включающая, с одной стороны, сведения о том, пригодна ли методика для измерения того, для чего она была создана, а с другой стороны, какова ее действенность, эффективность, практическая полезность.

Валидность – то, насколько методика измеряет то, что она должна измерять по своему замыслу. Уровень валидности называется коэффициент валидности. На валидность теста влияют систематические факторы. Они привносят искажения в результаты. Эти факторы есть другие психические свойства, которые мешают проявиться в результатах теста тому свойству, на которое тест направлен.

Например, мы хотим измерить «потенциал обученности», но даём испытуемому тест с жёстким ограничением времени исполнения и отсутствием возможности вернуться и исправить допущенную ошибку. В связи с этим искомое психическое свойство оказывается смешанным с другим – «стрессоустойчивостью»: испытуемые с высокими показателями стрессоустойчивости будут лучше выполнять тест. В этом проявится эффект систематического искажения.

По этой причине не существует какого-то единого универсального подхода к определению валидности. В зависимости от того, какую сторону валидности хочет рассмотреть исследователь, используются и разные способы доказательства. Другими словами, понятие валидности включает в себя разные ее виды, имеющие свой особый смысл. Проверка валидности методики называется валидизацией.

Валидность в первом ее понимании имеет отношение к самой методике, т. е. это валидность измерительного инструмента. Такая проверка называется теоретической валидизацией. Валидность во втором понимании уже относится не столько к методике, сколько к цели ее использования. Это прагматическая валидизация.



В современной психометрике разработаны буквально десятки разнообразных теоретических и экспериментальных методов проверки валидности тестов. Основным элементом практически всех этих методов является так называемый «критерий». Критерий валидности – это независимый от теста, внешний по отношению к тесту источник информации об измеряемом психическом свойстве. Мы не можем судить о валидности теста до тех пор, пока не сравним его результаты с источником истинной (или хотя бы заведомо валидной) информации об измеряемом свойстве – с критерием.

На практике очень часто в качестве критерия валидности используются прагматические критерии – это очевидный признак, который испытуемый проявляет независимо от того качества, которое мы исследуем. Например, показатели эффективности той деятельности, ради прогнозирования которой предпринималось тестирование. Или данные о выполнении различных заданий, контрольных проб, а также данные, полученные с помощью других методик, валидность которых является доказанной. Методика имеет столько валидностей, сколько у неё существует критериев.



Теоретическая валидность определяется по соответствиям показателей исследуемых качеств, полученных с помощью созданной методики, показателей, полученных с помощью других методик, или с показателями, для которых уже существуют теоретические обоснования. Проверяется с помощью корреляции одного и того же свойства, измеренного различными методами.

В рамках теоретической валидности выделяют:

- Конвергентную валидность . Наиболее благоприятная ситуация складывается тогда, когда в психологии уже имеется валидная методика, проверяющая изучаемое вами качество. В этом случае высокая корреляция между показателями данных методик говорит о том, что новая методика обладает конвергентной валидностью по отношению к старой.

- Конструктную валидность . Во многих случаях для измерения данного свойства не существует апробированного теста с известной валидностью. В этом случае исследователь формирует ряд гипотез о том, как будет коррелировать новый тест с другими тестами. Эти гипотезы выдвигаются на основе теоретических представлений об измеряемом свойстве. Их подтверждение указывает на валидность выдвигаемого конструкта, т.е. конструктную валидность (или предполагаемую валидность).

Эмпирическая валидность – проверяется по соответствию показателей диагностической методики реальному поведению, наблюдаемым действиям и реакциям испытуемого, т.е. мы смотрим, насколько в реальной жизни клиент ведёт себя соответственно результатам исследования.

Внутренняя валидность – соотношение в методике содержания отдельных заданий, субтестов, суждений общей цели замысла. Методика считается внутренне не валидной тогда, когда не все части методики измеряют то качество, которое требуется согласно цели. Внутренняя валидность – это внутренняя согласованность заданий методики.

Существует и ложная валидность – она фиксирует видимость пригодности методики.

Очевидная валидность – иногда действительно исследует реально существующие факты и закономерности, но соответствует подлинной только в дидактических тестах (например, тесты учебных достижений).

Валидность, исходящая из опыта – основывается на личном чувстве психолога, что данная методика является пригодной для измерения какого-либо качества, т.к. в её основе лежит хорошая теория или она даёт хорошие результаты.

Валидность, основанная на желаниях, – основана на желании видеть свою методику валидной, хорошей, при этом не замечая очевидных, противоречащих этому фактов.

Валидность всех тестовых методик, кроме дидактических, должна измеряться с помощью психометрических методов. Сколько испытуемых должно быть для расчёта валидности? Согласно практике, их не должно быть меньше 50, но лучше всего больше 200. Часто возникает вопрос: какой должна быть величина коэффициента валидности, чтобы она считалась приемлемой? Достаточно того, чтобы коэффициент валидности был статистически значимым. Низким признаётся коэффициент валидности порядка 0,20–0,30, средним – 0,30–0,50 и высоким – свыше 0,60.

Другим после надежности ключевым критерием оценки качества методик является валидность. Вопрос о валидности методики решается лишь после того, как установлена достаточная ее надежность, поскольку ненадежная методика не может быть валидной. Но самая надежная методика без знания ее валидности является практически бесполезной.

Следует заметить, что вопрос о валидности до сих пор представляется одним из самых сложных. Наиболее укоренившимся определением этого понятия является то, которое приведено в книге А. Анастази: «Валидность теста - понятие, указывающее нам, что тест измеряет и насколько хорошо он это делает».

Валидность по своей сути - это комплексная характеристика, включающая, с одной стороны, сведения о том, пригодна ли методика для измерения того, для чего она была создана, а с другой стороны, какова ее действенность, эффективность, практическая полезность.

По этой причине не существует какого-то единого универсального подхода к определению валидности. В зависимости от того, какую сторону валидности хочет рассмотреть исследователь, используются и разные способы доказательства. Другими словами, понятие валидности включает в себя разные ее виды, имеющие свой особый смысл. Проверка валидности методики называетсявалидизацией.

Валидность в первом ее понимании имеет отношение к самой методике, т.е. это валидность измерительного инструмента. Такая проверка называется теоретической валидизацией . Валидность во втором понимании уже относится не столько к методике, сколько к цели ее использования. Это -прагматическая валидизация.

Обобщая, можно сказать следующее:

при теоретической валидизации исследователя интересует само свойство, измеряемое методикой. Это, по существу, означает, что проводится собственно психологическая валидизация;

при прагматической валидизации суть предмета измерения (психологического свойства) оказывается вне поля зрения. Главный акцент сделан на то, чтобы доказать, что «нечто», измеряемое методикой, имеет связь с определенными областями практики.

Если опять обратиться к истории развития тестологии, то можно выделить такой период (20-30-е гг.), когда научное содержание тестов и их теоретический «багаж» интересовали в меньшей степени. Важно было, чтобы тест работал, помогал быстро отбирать наиболее подготовленных людей. Эмпирический критерий оценки тестовых заданий считался единственно верным ориентиром в решении научных и прикладных задач.

Поэтому на ранних стадиях развития тестологии, когда концепция валидности только складывалась, бытовало интуитивное представление о том, что именно данный тест измеряет:

    методика называлась валидной, так как то, что она измеряет, просто «очевидно»;

    доказательство валидности основывалось на уверенности исследователя в том, что его метод позволяет «понять испытуемого»;

    методика рассматривалась как валидная (т. е. принималось утверждение, что такой-то тест измеряет такое-то качество) только потому, что теория, на основании которой строилась методика, «очень хорошая».

Принятие на веру голословных утверждений о валидности методики не могло продолжаться длительное время. Первые проявления действительно научной критики развенчали такой подход: начались поиски научно обоснованных доказательств.

Использование диагностических методик с чисто эмпирическим обоснованием, без отчетливой теоретической базы нередко приводило к псевдонаучным выводам, к неоправданным практическим рекомендациям. Нельзя было точно назвать те особенности, качества, которые тесты выявляли. Б. М. Теплов, анализируя тесты того периода, назвал их «слепыми пробами».

Такой подход к проблеме валидности тестов был характерен вплоть до начала 50-х гг. не только в США, но и в других странах. Теоретическая слабость эмпирических методов валидизации не могла не вызвать критики со стороны тех ученых, которые в разработке тестов призывали опираться не только на «голую» эмпирику и практику, но и на теоретическую концепцию. Практика без теории, как известно, слепа, а теория без практики мертва. В настоящее время теоретико-прагматическая оценка валидности методик воспринимается как наиболее продуктивная.

В по­нятие валидности входит большое количество са­мой разнообразной информации о тесте. В целом она описывает сферу при­менения методики и отражает уровень обоснованности результатов измерения. Различные категории этих сведений и способы их получения образуют различные типы валидности. Основными типами считаются содержательная валидность, конструктная валидность и критериаль­ная валидность. Классификация типов валидности в достаточной мере условна, так как нередко для различ­ных критериев валидности применяются общие ме­тоды определения, а с другой стороны, одни и те же исходные данные могут ин­терпретироваться с точки зрения различных ти­пов валидности. На рис. 2 приведена примерная схе­ма, отражающая виды и связи валидности.

Провести теоретическую валидизацию, в отличие от прагматической, порой оказывается значительно труднее. Не вдаваясь пока в конкретные детали, остановимся в общих чертах на том, как проверяется прагматическая валидность: выбирается какой-нибудь независимый от методики внешний критерий, определяющий успех в той или иной деятельности (учебной, профессиональной и т. п.), и с ним сравниваются результаты диагностической методики. Если связь между ними признается удовлетворительной, то делается вывод о практической значимости, эффективности, действенности диагностической методики. Для определения теоретической валидности найти какой-либо независимый критерий, лежащий вне методики, гораздо труднее. Теоретическая валидность складывается из содержательной и конструктной.

Валидность по содержанию заклады­вается в тест уже при подборе заданий будущей методики. В содержательной валидности реализуется синтетический подход в анализе элементного состава содержания самого теста, а не совокупности внешних критериев валидизации. Первым этапом валидизации является определение круга ис­следуемых свойств и видов деятельности, расчленение сложной способности или деятельности на элементы. На втором этапе разрабатывают собственно модель тестовой деятельности на основе наибо­лее важных элементов реальной деятель­ности. Наконец, на последнем этапе про­водят анализ степени соответствия разра­ботанной модели реальной деятельности, проверку соответствия пропорций представленности элементов в заданиях теста и в реальной деятельности. Так, для тес­тов достижений по отдельным предме­там разработке конкретного содержания тестовых задач предшествуют полная си­стематическая проверка соответствую­щих учебников и учебных программ, а также консультации со специалистами по данному предмету. На основе собранной таким путем информации составляют спе­цификацию теста, где указывают тестиру­емые области содержания (темы), задачи (процессы) обучения, а также относи­тельное значение каждой темы и процес­са для достижения целей обучения на дан­ном этапе. Конкретные задания оценива­ются экспертами по принципу их близос­ти к реальным требованиям (логическая валидность ). Эксперты вы­носят суждения о том, охватывает ли тест репрезентативную выборку конкретных навыков и знаний исследуемой области обучения. Широкое использование экспертных оценок сближает содержательную валидность с процедурой опре­деления валидности критериальной. Однако существенным различием между этими типами валидности является то, что экспертные оценки при анализе содер­жания являются критерием самого теста, в то время как при критериальной валидизации они относятся к испытуемым из вы­борки стандартизации.

Рис. 2. Основные виды валидности

Наряду с тестами достижений содержательная валидность является одной из важнейших форм вали­дизации тестов критериально-ориен­тированных, а также методик, предна­значенных для профотбора, анализа ус­пешности овладения профессией. Для валидизации опросников личнос­тных и тестов интеллекта критерии содержательной валидности имеют ограниченное применение и используются лишь на начальных стадиях составления теста.

Очевидная валидность -представление о тесте, сфере его применения, результативности и прогностической цен­ности, которое возникает у испытуемого или другого лица, не располагающего спе­циальными сведениями о характере ис­пользования и целях методики. Очевидная валидность не является компонентом объективно уста­навливаемой валидности. Вместе с тем высокая очевидная валидность в большинстве случаев яв­ляется весьма желательной. Она выступа­ет в качестве фактора, побуждающего ис­пытуемых к обследованию, способствует более серьезному и ответственному отно­шению к работе по выполнению заданий теста и к заключениям, формулируемым психологом. Достаточный уровень очевидной валидности особенно значим для методик обследования взрос­лых.

Конструктная валидность - один из основных типов валидности, от­ражающий степень репрезентации иссле­дуемого психологического конструкта в результатах теста. В качестве конструкта могут выступать практический или вер­бальный интеллект, эмоциональная неус­тойчивость, интроверсия, понимание ре­чи, переключаемость внимания и т. д. Иначе говоря, конструктная валидность определяет область те­оретической структуры психологических явлений, измеряемых тестом.

Поскольку проявления таких конст­руктов, как, например, интеллект в деятельно­сти человека многообразны и неоднознач­ны с точки зрения их выделения, процедура уста­новления конструктная валидность по сравнению с валиднос­тью критериальной или валидностью содержательной более сложна.

Среди конкретных методов характери­стики конструктной валидности в первую очередь необходимо назвать сопоставление исследуемого на предмет конструктной валидности теста с другими методиками, конструктное содержание которых известно. Наличие корреляции между новым и аналогичным по конструкту тестом ука­зывает на то, что разрабатываемый тест «измеряет» примерно ту же сферу поведе­ния, способность, личностное качество, что и эталонная методика.

При анализе конструктной валидности методики обычно формулируют ряд гипотез о том, как будет коррелировать разрабатываемый тест с широким кругом других тестов, направ­ленных на конструкты, находящиеся в те­оретически известной или предполагае­мой связи с исследуемыми. При этом конструктная валидность характеризуется не только связями про­веряемого теста с близкородственными показателями, но и с теми, где, исходя из гипотезы, значимых связей наблюдаться не должно. Эти подходы определяются как конвергентная (проверка степени близости прямой или обратной связи) и дискриминантная (установление отсут­ствия связи) валидизации. Подтвержде­ние совокупности теоретически ожидае­мых связей составляет важный круг све­дений конструктной валидности. В англоязычной психодиагностике такое операциональное определе­ние конструктной валидности обозначается как «предполагае­мая валидность» (assumed validity).

Инкрементная валидность (англ. incremental - приращение, при­быль) - один из компонентов критери­альной валидности, прогностической валидности теста, отражающий практи­ческую ценность методики при проведе­нии отбора. Инкрементная валидность может быть выражена количественно при помощи коэффициента валидности.

Показатель инкрементной валидности указывает на роль те­ста в улучшении отбора лиц для реальной деятельности, степень улучшения резуль­тативности процедуры отбора по сравне­нию с традиционной, основанной на ана­лизе объективных сведений, документов, бесед, приеме с испытательным сроком и т. д.

Прямое отношение к характеристике конструктной валидности имеет факторный анализ, позволя­ющий строго статистически проанализи­ровать структуру связей показателей ис­следуемого теста с другими известными и латентными факторами, выявить общие и специфические для группы сопоставляе­мых тестов факторы, степень их представ-ленности в результатах, т. е. определить факторный состав и факторные нагрузки результата теста. Исключительная важ­ность такой процедуры является основа­нием для выделения ее в особый вид конструктной валидности - факторную валидность.

Важным аспектом конструктной валидности является внутренняя согласованность, отражаю­щая то, насколько определенные пункты (задания, вопросы), составляющие мате­риал теста, подчинены основному направ­лению теста как целого, ориентированы на изучение одних и тех же конструктов. Анализ внутренней согласованности осу­ществляется путем коррелирования отве­тов на каждое задание с общим результа­том теста. Следует отметить, что крите­рий внутренней согласованности указы­вает лишь на меру связи всего содержа­ния теста с измеряемым конструктом, да­вая лишь косвенную информацию о при­роде измеряемого свойства.

При определении конструктной валидности важное место принадлежит изучению динамики измеря­емого конструкта. При этом мы можем опираться на гипотезы о его возрастном развитии, влиянии тренировок, обучения, освоения профессии и т. д. Одним из та­ких подходов является применение крите­рия возрастной дифференциации (ва­лидность по возрастной дифференциа­ции ). Характери­стика валидности по конструкту здесь за­ключается в определении соответствия результатов теста теоретически ожидае­мым и практически наблюдаемым возрастным изменениям данного конструкта или свойства. Наибольшее значение валидности по возрастной дифференциации имеет для характеристики валидности тестов, направленных на измерение психологи­ческих свойств, функций, отличающихся относительно быстрым изменением под воздействием индивидуального опыта, вы­раженной иерархичностью ступеней раз­вития (осведомленность, навыки, интел­лектуальные операции и др.). Критерий валидности по возрастной дифференциации обычно не находит широкого применения при валидизации методик, предназначенных для психологи­ческой диагностики функций, свойств, не обнаруживающих четкой и однознач­ной тенденции к возрастным изменениям. К их числу, в частности, относятся мето­дики диагностики личности.

В комплекс сведений о конструктной валидности методики входят также данные, относящиеся к сфе­ре критериальной и содержательной валидности. Так, критерии, используемые при валидизации, несут информацию, по­зволяющую раскрыть область поведения, качества, представленные в тесте в виде конструкта. Для характеристики конструктной валидности не­обходимы связь с практическими форма­ми деятельности, достоверность прогноза реального поведения. Однако конструктная валидность являет­ся качественно более высоким и комплек­сным уровнем описания теста, характери­зуя область измеряемого поведения в ши­роких психологических понятиях. Благо­даря данным конструктной валидности мы можем с психологи­ческих позиций закономерно объяснить результаты теста и их дисперсию, обосно­вать диагноз, введя измеряемое свойство в систему психологических категорий, прогнозировать поведение в более широ­ких пределах, чем это задается областью деятельности, для которой определялась содержательная валидность.

Таким образом, провести теоретическую валидизацию методики - это доказать, что методика измеряет именно то свойство, качество, которое она по замыслу исследователя должна измерять. Для теоретической валидизации кардинальной проблемой является отношение между психологическими явлениями и их показателями, посредством которых эти психологические явления пытаются познать. Такая проверка показывает, насколько замысел автора и результаты методики совпадают.

Не столь сложно провести теоретическую валидизацию новой методики, если для измерения данного свойства уже имеется методика с доказанной валидностью. Наличие корреляции между новой и аналогичной, уже проверенной методикой указывает на то, что разработанная методика измеряет то же психологическое качество, что и эталонная. Такой прием особенно часто применяется в дифференциальной психофизиологии при создании методик диагностики основных свойств нервной системы человека.

Гораздо труднее провести теоретическую валидизацию методики тогда, когда такой путь проверки невозможен. Чаще всего именно с такой ситуацией сталкивается исследователь. В таких обстоятельствах только постепенное накопление разнообразной информации об изучаемом свойстве, анализ теоретических предпосылок и экспериментальных данных, значительный опыт работы с методикой позволяют раскрыть ее психологический смысл.

Важную роль для понимания того, что методика измеряет, играет сопоставление ее показателей с практическими формами деятельности. Но здесь особенно важно, чтобы методика была тщательно проработана в теоретическом плане, т. е. чтобы имелась прочная, обоснованная научная база. Тогда при сопоставлении методики с взятым из повседневной практики внешним критерием, соответствующим тому, что она измеряет, может быть получена информация, подкрепляющая теоретические представления об ее сущности.

Важно помнить, что если доказана теоретическая валидность, то интерпретация полученных показателей становится более ясной и однозначной, а название методики соответствует сфере ее применения.

Что касается прагматической валидизации, то она подразумевает проверку методики с точки зрения ее практической эффективности, значимости, полезности, поскольку диагностической методикой имеет смысл пользоваться только тогда, когда доказано, что измеряемое свойство проявляется в определенных жизненных ситуациях, в определенных видах деятельности. Ей придают большое значение особенно там, где встает вопрос отбора.

Для проведения прагматической валидизации методики, т. е. для оценки ее эффективности, действенности, практической значимости, обычно используется независимыйвнешний критерий - показатель проявления изучаемого свойства в повседневной жизни. Такими критериями могут быть:

    успеваемость (для тестов способностей к обучению, тестов достижений, тестов интеллекта);

    производственные достижения (для методик профессиональной направленности);

    эффективность реальной деятельности - рисование, моделирование и т.д. (для тестов специальных способностей);

    субъективные оценки (для тестов личности).

Американские исследователи Д. Тиффин и Е. Маккормик, проведя анализ используемых для доказательства валидности внешних критериев, выделили четыре их типа:

    критерии исполнения (в их число могут входить такие, как количество выполненной работы, успеваемость, время, затраченное на обучение, темп роста квалификации и т. п.);

    субъективные критерии (они включают различные виды ответов, которые отражают отношение человека к чему-либо или к кому-либо, его мнение, взгляды, предпочтения; обычно субъективные критерии получают с помощью интервью, опросников, анкет);

    физиологические критерии (они используются при изучении влияния окружающей среды и других ситуационных переменных на организм и психику человека; замеряется частота пульса. давление крови, электросопротивление кожи, симптомы утомления и т. д.);

    критерии случайностей (применяются, когда цель исследования касается, например, проблемы отбора для работы таких лиц, которые менее подвержены несчастным случаям).

Внешний критерий должен отвечать трем основным требованиям:

    он должен быть релевантным;

    свободным от помех (контаминации);

    надежным.

Под релевантностью имеется в виду смысловое соответствие диагностического инструмента независимому жизненно важному критерию. Другими словами, должна быть уверенность в том, что в критерии задействованы именно те особенности индивидуальной психики, которые измеряются и диагностической методикой. Внешний критерий и диагностическая методика должны находиться между собой во внутреннем смысловом соответствии, быть качественно однородными по психологической сущности.

Если, например, тест измеряет индивидуальные особенности мышления, умение выполнять логические действия с определенными объектами, понятиями, то и в критерии нужно искать проявление именно этих умений. Это в равной степени относится и к профессиональной деятельности. Она имеет не одну, а несколько целей, задач, каждая из которых специфична и предъявляет свои условия к выполнению. Из этого вытекает существование нескольких критериев выполнения профессиональной деятельности. Поэтому не следует проводить сопоставление успешности по диагностическим методикам с производственной эффективностью в целом. Необходимо найти такой критерий, который по характеру выполняемых операций соотносим с методикой.

Если относительно внешнего критерия неизвестно, релевантен он измеряемому свойству или нет, то сопоставление с ним результатов психодиагностической методики становится практически бесполезным. Оно не позволяет прийти к каким-либо выводам, которые могли бы дать оценку валидности методики.

Требования свободы от помех (контаминации) вызываются тем, что, например, учебная или производственная успешность зависит от двух переменных: от самого человека, его индивидуальных особенностей, измеряемых методиками, и от ситуации, условий учебы, труда, которые могут привнести помехи, «загрязнить» применяемый критерий. Чтобы в какой-то мере избежать этого, следует отбирать для исследования такие группы людей, которые находятся в более или менее одинаковых условиях. Можно использовать и другой метод. Он состоит в корректировке влияния помех. Эта корректировка носит обычно статистический характер. Так, например, производительность следует брать не по абсолютным значениям, а в отношении к средней производительности рабочих, имеющих аналогичные условия труда.

Когда говорят, что критерий должен иметь статистически достоверную надежность , это означает, что он должен отражать постоянство и устойчивость исследуемой функции.

Поиски адекватного и легко выявляемого критерия относятся к очень важным и сложным задачам валидизации. В западной тестологии много методик дисквалифицировано только потому, что не удалось подыскать подходящего критерия для их проверки. В частности, у большей части анкет данные по их валидности сомнительны, так как трудно найти адекватный внешний критерий, отвечающий тому, что они измеряют.

Существует несколько видов критериальной валидности, обусловленных особенностями диагностических методик, а также временным статусом внешнего критерия. Однако чаще всего называются следующие:

    Валидность по одновременности (текущая валидность , или диагностическая валидность) определяется с помощью внешнего критерия, по которому информация собирается одновременно с экспериментами по проверяемой методике. Другими словами, собираются данные, относящиеся к настоящему времени: успеваемость в период испытания, производительность в этот же период и т. д. С ними сопоставляют результаты успешности по тесту.

    «Предсказывающая» валидность (другое название - прогностическая валидность ). Определяется также по внешнему критерию, но информация по нему собирается некоторое время спустя после испытания. Внешним критерием обычно бывает выраженная в каких-либо оценках способность человека к тому виду деятельности, для которой он оценивался по результатам диагностических испытаний. Хотя этот прием наиболее соответствует задаче диагностических методик - предсказанию будущей успешности, - применять его очень трудно. Точность диагноза находится в обратной зависимости от времени, заданного для такого прогнозирования. Чем больше проходит времени после измерения, тем большее количество факторов требуется учитывать при оценке прогностической значимости методики. Однако учесть все факторы, влияющие на предсказание, практически невозможно.

    Ретроспективная валидность . Она определяется на основе критерия, отражающего события или состояние качества в прошлом. Может быть использована для быстрого получения сведений о предсказательных возможностях методики. Так, для проверки того, в какой мере хорошие результаты теста способностей соответствуют быстрому обучению, можно сопоставить прошлые оценки успеваемости, прошлые экспертные заключения и т. д. у лиц с высокими и низкими на данный момент диагностическими показателями.

Оценка валидности методик может носить количественный и качественный характер.

Для вычисления количественного показателя - коэффициента валидности - сопоставляются результаты, полученные при применении диагностической методики, с данными, полученными по внешнему критерию тех же лиц. Используются разные виды линейной корреляции (по Спирмену, по Пирсону).

Сколько испытуемых необходимо для расчета валидности? Практика показала, что их не должно быть меньше 50, однако лучше всего более 200. Часто возникает вопрос, какой должна быть величина коэффициента валидности, чтобы она считалась приемлемой? В общем, отмечается, что достаточно того, чтобы коэффициент валидности был статистически значим. Низким признается коэффициент валидности порядка 0,2-0,3, средним - 0,3-0,5 и высоким - свыше 0,6.

Но, как подчеркивают А. Анастази, К. М. Гуревич и др., не всегда для вычисления коэффициента валидности правомерно использовать линейную корреляцию. Этот прием оправдан лишь тогда, когда доказано, что успех в какой-то деятельности прямо пропорционален успеху в выполнении диагностической пробы. Позиция зарубежных тестологов, особенно тех, кто занимается профпригодностью и профотбором, чаще всего сводится к безоговорочному признанию того, что для профессии больше подойдет тот, кто больше выполнил заданий в тесте. Но может быть и так, что для успеха в деятельности нужно обладать свойством на уровне 40 % решения теста. Более высокий показатель в тесте уже не имеет никакого значения для профессии.

Наглядный пример из монографии К. М. Гуревича: почтальон должен уметь читать, но читает ли он с обычной скоростью или с очень большой скоростью - это уже не имеет профессионального значения.

При таком соотношении показателей методики и внешнего критерия наиболее адекватным способом установления валидности может быть критерий различий.

Возможен и другой случай: более высокий уровень свойства, чем это требует профессия, служит помехой профессиональному успеху. Так, еще на заре ХХ в. американский исследователь Ф. Тейлор нашел, что наиболее развитые работницы производства имеют невысокую производительность труда,то есть высокий уровень их умственного развития мешал им высокопроизводительно трудиться. В этом случае для вычисления коэффициента валидности более подошли бы дисперсионный анализ или вычисление корреляционных отношений.

Как показал опыт работы зарубежных тестологов, ни одна статистическая процедура не в состоянии полностью отразить многообразие индивидуальных оценок. Поэтому часто для доказательства валидности методик используют другую модель - клинические оценки. Это не что иное, как качественное описание сущности изучаемого свойства . В этом случае речь идет об использовании приемов, не опирающихся на статистическую обработку.

В психологической диагностике валидность - обязательная и наибо­лее важная часть сведений о методике, включающая:

    данные о степени согласованности ре­зультатов теста с другими сведениями об исследуемой личности, полученными из различных источников (теоретические ожидания, наблюдение, экспертные оцен­ки, результаты других методик, достовер­ность которых установлена и т. д.),

    суж­дение об обоснованности прогноза разви­тия исследуемого качества,

    связь изучае­мой области поведения или особенности личности с определенными психологичес­кими конструктами.

    конкретную направленность методики (контингент испытуемых по возрасту, уровню образования, социально-культур­ной принадлежности и т. д.) и

    степень обоснованности выводов в конкретных условиях использования теста и т.д.

В сово­купности сведений, характеризующих валидность теста, содержится информация об адек­ватности применяемой модели деятельно­сти с точки зрения отражения в ней изучаемой пси­хологической особенности, о степени од­нородности заданий (субтестов), вклю­ченных в тест, их сопоставимости при ко­личественной оценке результатов теста в целом.

При приведении данных о валидности разработанной методики важно точно указать, какой вид валидности имеется в виду (по содержанию, по одновременности и т. д.). Желательно также сообщать сведения о численности и особенностях индивидов, на которых проводилась валидизация. Такая информация позволяет пользователям методики решить, насколько валиден этот прием для той группы, к которой он собирается его применять. Как и в случае с надежностью, необходимо помнить, что в одной выборке методика может обладать высокой валидностью, а в другой - низкой. Поэтому, если исследователь планирует использовать методику на выборке испытуемых, существенно отличающейся от той, на которой проводилась проверка валидности, ему необходимо заново провести такую проверку. Приводимый в руководстве коэффициент валидности применим только к группам испытуемых, подобных тем, на которых он определялся.

Известны два пути создания психодиагностических методик: адаптация известных методик (зарубежных, устаревших, с иными целями) и разработка новых, оригинальных методик.

Для того чтобы психолого-педагогический эксперимент был достаточно надежным средством исследования и позволял по­лучать вполне достоверные результаты, которым можно доверять и на основе которых можно делать правильные практические вы­воды, необходимо, чтобы используемые в нем психодиагности­ческие методы были научно обоснованными. Такими считают ме­тоды, отвечающие следующим требованиям: валидность, надеж­ность, однозначность и точность.

Термин «валидность» буквально означает: «полноценный», «пригодный», «соответст­вующий». Валидность по своей сути - это комплексная характеристика, включающая, с одной стороны, сведения о том, пригодна ли методика для измерения того, для чего она была создана, а с другой стороны, какова ее действенность, эффективность . Проверка валидности методики называется валидизацией.

Есть несколько разновидностей валидности, каждую из ко­торых следует рассматривать и оценивать отдельно, когда стоит вопрос о выяснении валидности психодиагностической методи­ки. Валидность может быть теоретической и практической (эм­пирической), внутренней и внешней.

Валидность теоретическая определяется по соответствию по­казателей исследуемого качества, получаемых с помощью дан­ной методики, показателям, получаемым посредством других методик - таких, с показателями которых должна существовать теоретически обоснованная зависимость. Теоретическую валидность проверяют по корреляциям показателей одного и того же свойства, получаемым при помощи разных методик, опирающих­ся или исходящих из одной и той же теории.

Валидностъ эмпирическая проверяется по соответствию диа­гностических показателей реальному поведению, наблюдаемым действиям и реакциям испытуемого. Если, например, с помощью некоторой методики мы оцениваем черты характера у данного испытуемого, то применяемая методика будет считаться прак­тически или эмпирически валидной тогда, когда мы установим, что данный человек ведет себя в жизни именно так, как предска­зывает методика, т.е. в соответствии с имеющейся у него чертой характера. По критерию эмпирической валидности методику проверя­ют путем сравнения ее показателей с реальным жизненным по­ведением или результатами практической деятельности людей.

Валидностъ внутренняя означает соответствие содержащих­ся в методике заданий, субтестов, суждений и т.п. общей цели и замыслу методики в целом. Она считается внутренне невалидной или недостаточно внутренне валидной тогда, когда все или часть включенных в нее вопросов, заданий или субтестов изме­ряют не то, что требуется от данной методики.

Валидностъ внешняя - это примерно то же самое, что и эм­пирическая валидность, с той лишь разницей, что в данном слу­чае речь идет о связи между показателями методики и наиболее важными, ключевыми внешними признаками, относящимися к поведению испытуемого.


При создании методики сразу оценить ее валидность трудно. Обычно валидность методики проверяется и уточняется в про­цессе ее достаточно длительного использования, тем более что речь идет о проверке по меньшей мере с четырех описанных выше сторон.

Не существует какого-то единого универсального подхода к определению валидности. В зависимости от того, какую сторону валидности хочет рассмотреть исследователь, используются и разные способы доказательства. Другими словами, понятие валидности включает в себя разные ее виды, имеющие свой особый смысл.

Существует четыре типа внешних критериев , используемых для доказательства валидности:

1) критерии исполнения (в их число могут входить такие, как количество выполненной работы, успеваемость, время, затраченное на обучение, темп роста квалификации;

2) субъективные критерии (они включают различные виды ответов, которые
отражают отношение человека к чему-либо или к кому-либо, его мнение, взгляды,
предпочтения; обычно субъективные критерии получают с помощью интервью, опросников, анкет);

3) физиологические критерии (они используются при изучении влияния окружающей среды и других ситуационных переменных на организм и психику человека; замеряется частота пульса, давление крови, электросопротивление кожи, симптомы утомления и т.д.);

4) критерии случайностей (применяются, когда цель исследования касается, например, проблемы отбора для работы таких лиц, которые менее подвержены несчастным случаям).

Поиски адекватного и легко выявляемого критерия относятся к очень важным и сложным задачам валидизации.

Существует нескольковидов валидности , обусловленных особенностями диагностических методик, а также временным статусом внешнего критерия:

1) Валидность "по содержанию". Этот прием используется в основном в тестах достижений. Обычно в тесты достижений включается не весь материал, который прошли учащиеся, а какая-то его небольшая часть (3-4 вопроса). Можно ли быть уверенным в том, что правильные ответы на эти немногие вопросы свидетельствуют об усвоении всего материала. На это и должна ответить проверка валидности по содержанию. Для этого проводится сопоставление успешности по тесту с экспертными оценками учителей (по данному материалу). Валидность "по содержанию" также подходит к критериально-ориентированным тестам. Иногда этот прием называют логической валидностью .

2) Валидность "по одновременности", или текущая валидность, определяется с помощью внешнего критерия, по которому информация собирается одновременно с
экспериментами по проверяемой методике. Другими словами, собираются данные, относящиеся к настоящему времени (успеваемость в период испытания, производительность в этот же период и т д.). С ними коррелируют результаты успешности по тесту.

3) "Прогностическая" валидность . Определяется также по достаточно надежному внешнему критерию, но информация по нему собирается некоторое время спустя после испытания. Внешним критерием обычно бывает выраженная в каких-нибудь оценках способность человека к тому виду деятельности, для которой он отбирался по результатам диагностических испытаний. Хотя этот прием наиболее соответствует задаче диагностических методик - предсказанию будущей успешности, применять его очень трудно. Точность прогноза находится в обратной зависимости от времени, заданного для такого прогнозирования. Чем больше проходит времени после измерения, тем большее количество факторов требуется учитывать при оценке прогностической значимости методики. Однако учесть все факторы, влияющие на предсказание, практически невозможно.

4) "Ретроспективная" валидность. Она определяется на основе критерия,
отражающего события или состояние качества в прошлом. Может быть использована для быстрого получения сведений о предсказательных возможностях методики. Так, для проверки того, в какой мере хорошие результаты теста способностей соответствуют быстрому обучению, можно сопоставить прошлые оценки успеваемости, прошлые экспертные заключения и т.д. у лиц с высокими и низкими на данный момент диагностическими показателями.

При приведении данных о валидности разработанной методики важно точно указать, какой вид валидности имеется в виду (по содержанию, по одновременности и т.д.). Желательно также сообщать сведения о численности и особенностях индивидов, на которых проводилась валидизация. Такая информация позволяет пользующемуся методикой исследователю решить, насколько валиден этот прием для той группы, к
которой он собирается его применять. Как и в случае с надежностью, необходимо помнить, что в одной выборке методика может обладать высокой валидностью, а в другой - низкой. Поэтому если исследователь планирует использовать методику на выборке испытуемых, существенно отличающейся от той, на которой проводилась проверка валидности, ему необходимо заново провести такую проверку.

Кроме видов валидности, важно знать критерии валидности . Это основные признаки, по которым можно практически судить о том, является или не является данная методика валидной. Та­кими критериями могут стать следующие:

1. Поведенческие показатели - реакции, действия и поступ­ки испытуемого в различных жизненных ситуациях.

2. Достижения испытуемого в различных видах деятельно­сти: учебной, трудовой, творческой и других.

3. Данные, свидетельствующие о выполнении различных конт­рольных проб и заданий.

4. Данные, получаемые при помощи других методик, валидность или связь которых с проверяемой методикой считается до­стоверно установленной.

Прежде чем психодиагностические методики могут быть использованы для практических целей, они должны пройти проверку по ряду формальных критериев, доказывающих их высокое качество и эффективность. К числу основных критериев оценки психодиагностических методик относятся надежность и валидность.

Большой вклад в разработку этих понятий внесли зарубежные психологи (А. Анастази, Е. Гизелли, Дж. Гилфорд, Л. Кронбах, Р. Торндайк, Е. Хаген и др.). Ими были разработаны формально-логический и математико-статистический аппарат (прежде всего корреляционный метод и фактический анализ) обоснования степени соответствия методик отмеченным критериям.

В традиционной тестологии термин «надёжность» означает относительное постоянство, устойчивость, согласованность результатов теста при первичном и повторном его применении на одних и тех же испытуемых.

Надёжность методики – это критерий, который говорит о точности психологических измерений, то есть позволяет судить о том, насколько внушают доверие полученные результаты.

Это согласованность результатов тестирования испытуемых в разные моменты времени, при первичном и вторичном тестировании и с использованием разных по эквивалентности, по содержанию заданий. Надежность характеризует тесты свойств, но не состояний. Свойства:

  1. Воспроизводимость рез-тов исследования.
  2. Точность измерения.
  3. Устойчивость результатов.

Степень надёжности методик зависит от многих причин. Среди негативных факторов наиболее часто называются следующие:

  1. нестабильность диагностируемого свойства;
  2. несовершенство диагностических методик (небрежно составлена инструкция, задания по своему характеру разнородны, нечётко сформулированы указания по предъявлению методики испытуемым и т.д.);
  3. меняющаяся ситуация обследования (разное время дня, когда проводятся эксперименты, разная освещённость помещения, наличие или отсутствие посторонних шумов и т.д.);
  4. различия в манере поведения экспериментатора (от опыта к опыту по-разному предъявляет инструкции, по-разному стимулирует выполнение заданий и т.д.);
  5. колебания в функциональном состоянии испытуемого (в одном эксперименте отмечается хорошее самочувствие, в другом – утомление и т.д.);
  6. элементы субъективности в способах оценки и интерпретации результатов (когда ведётся протоколирование ответов испытуемых, оценивают ответы по степени полноты, оригинальности и т.д.).

Одним из важнейших средств повышения надежности методики является единообразие процедуры обследования, его строгая регламентация: одинаковая обстановка, однотипный характер инструкций, одинаковые для всех временные ограничения, способы и особенности контакта с испытуемыми и так далее.

На характеристику надёжности методик большое влияние оказывает исследуемая выборка. Она может, как снижать, так и завышать этот показатель, например, надежность, может быть искусственно завышена, если в выборке небольшой разброс результатов, т.е. если результаты по своим значениям близки друг к другу. Поэтому в руководстве обычно делается описание выборки, на котором определялась надёжность методики.

В настоящее время надежность все чаще определяется на наиболее однородных выборках, т.е. на выборках, схожих по полу, возрасту, уровню образования, профессиональной подготовке и т.п.

Разновидностей надёжности методик так же много, как и условий, влияющих на результаты диагностических испытаний. Так как все виды надёжности отражают степень согласованности двух независимо полученных рядов показателей, то математико-статистический приём, с помощью которого устанавливается надёжность методики, - это корреляции (по Пирсону или Спирмену). Надёжность тем выше, чем больше полученный коэффициент корреляции приближается к единице, и наоборот.

К.М. Гуревич предложил толковать надёжность как:

  1. надёжность самого измерительного инструмента (коэффициент надежности);
  2. стабильность изучаемого признака (коэффициент стабильности);
  3. константность, т.е. относительную независимость результатов от Личности экспериментатора (коэффициент константности).

Показатель, характеризующий измерительный инструмент, предлагается называть коэффициентом надёжности; показатель, характеризующий стабильность измеряемого свойства, - коэффициентом стабильности; а показатель оценки влияния Личности экспериментатора – коэффициентом константности. Именно в таком порядке рекомендуется осуществлять проверку методики: целесообразно сначала проверить инструмент измерения. Если полученные данные удовлетворительны, то можно переходить к установлению меры стабильности измеряемого свойства, а уже после этого при необходимости заняться критерием константности. (Надёжность: ретестовая, параллельных форм, частей тела, по внутренней согласованности, факторно-дисперсионная).

Определение надежности измерительного инструмента. От того как составлена методика, насколько правильно подобраны задания, насколько она однородна зависит точность, объективность измерения.

Для проверки надежности измерительного инструмента, говорящего о его однородности (гомогенности) используют метод расщепления. Задания делят на четные и нечетные (необходимо выполнение всех заданий), а затем результаты коррелируются между собой. Если методика однородна, то большой разницы в успешности по этим половинам не будет, коэффициент будет высоким. Можно сравнивать по частям, но лучше по четным и нечетным, т.к. этот способ не зависит от тренировки, утомления и т.д.

Методика надежна, если коэффициент не ниже 0,75 – 0,85, лучше 0,90 и выше.

Определение стабильности изучаемого признака. Также необходимо установить насколько устойчив, стабилен признак, который исследователь намерен измерять. Признак со временем может меняться, но колебания его не должны иметь непредсказуемый характер.

Для проверки используется прием, который называется тест-ретест. Он заключается в повторном обследовании испытуемых с помощью этой же методики. О стабильности судят по коэффициенту корреляции между результатами первого и второго обследования. Он будет свидетельствовать о сохранении или не сохранении каждым испытуемым своего порядкового номера в выборке.

На степень устойчивости влияет разнообразие фактора. Необходимо соблюдать единообразие процедуры обследования.

При определении стабильности признака большое значение имеет промежуток времени между 1 и 2 обследованиями. Чем короче этот промежуток, тем больше шансов, что этот признак сохраняет уровень первого испытания. Целесообразно проводить повторное тестирование через короткий срок после тестирования. Экспериментатор сам устанавливает этот срок, но чаще в психологической литературе указывают на интервал от нескольких месяцев (но не более полугода). Вопрос о стабильности измеряемого свойства решается не всегда единообразно. Решение зависит от сущности диагностируемого признака.

Если измеряемое свойство уже сформировано, то коэффициент должен быть не ниже 0,80.

Определение константности , т.е. относительная независимость результатов от Личности экспериментатора. Так как методика разрабатывается для дальнейшего использования ее другими психодиагностами, необходимо определить в какой мере ее результаты поддаются влиянию личности экспериментатора. Коэффициент константности определяется путем корреляции результатов двух опытов, проводимых на одной и той же выборке, но разными экспериментаторами. Коэффициент корреляции не должен быть ниже 0,80.

Вопрос о валидности решается после того, как установлена надежность, так как ненадежная методика не может быть валидной.

Валидность теста – понятие, указывающее нам, что тест измеряет и насколько хорошо он это делает (А. Анастази). Валидность по своей сути – это комплексная характеристика, включающая, с одной стороны, сведения о том, пригодна ли методика для измерения того, для чего она была создана, а с другой стороны, какова её действенность, эффективность, практическая полезность.

По этой причине не существует какого-то единого универсального подхода к определению валидности. В зависимости от того, какую сторону валидности хочет рассмотреть исследователь, используются и разные способы доказательства. Другими словами, понятие валидности включает в себя разные ее виды, имеющие свой особый смысл. Проверка валидности методики называется валидизацией.

Валидность – соответствие конкретного исследования принятым стандартам (безупречному эксперименту).

Валидность в первом ее понимании имеет отношение к самой методике, т.е. это валидность измерительного инструмента. Такая про-верка называется теоретической валидизацией. Валидность во втором ее понимании уже относится не столько к методике, сколько к цели ее использования. Это прагматическая валидизация.

При теоретической валидизации исследователя интересует само свойство, измеряемое методикой.

Так как для определения теоретической валидизации тяжело найти какой-нибудь независимый критерий, лежащий вне методики, и поэтому раньше принимались на веру голословные утверждения о валидности этой методики. Так как теоретическая валидизация направлена на доказательство того, что методика измеряет именно свойство, которое она должна измерить. Для теоретической валидизации кардинальной проблемой является отношение между психологическими явлениями и их показателями, по средствам которой эти психологические явления пытаются познать. Она показывает, что замысел автора и результаты методики совпадают.

Не столь сложно осуществить теоретическую валидизацию новой методики, если для измерения данного свойства уже имеется методика с известной, доказанной валидностью. Наличие корреляции между новой и аналогичной старой методиками указывает на то, что разработанная методика измеряет то же психологическое качество, что и эталонная.

Для проверки теоретической валидности важно, с одной стороны, установить степень связи с родственной методикой (конвергентная валидность), а с другой – отсутствие этой связи с методиками, имеющими другое теоретической основание (дискриминантная валидность).

Важную роль для понимания того, что методика измеряет, играет сопоставление ее показателей с практическими формами Деятельности. Важно чтобы методика была проработана в теоретическом плане.

Прагматическая валидизация

Проверяется практическая эффективность, значимость, полезность методики, так как методикой можно пользоваться только тогда, когда доказано, что измеряемое свойство проявляется в определенных видах Деятельности.

Для проверки прагматической валидности используется независимый внешний критерий – показатель проявления изучаемого свойства в повседневной жизни. В качестве такого критерия могут выступать успеваемость (для тестов способностей к обучению, тестов достижений, тестов интеллекта), производственные достижения (для методик профессиональной направленности), эффективность реальной Деятельности – рисования, моделирования и так далее (для тестов специальных способностей), субъективные оценки (для тестов Личности).

Американские исследователи Тиффин и Маккормик выделили 4-е типа внешнего критерия:

  1. Критерий исполнения (количество выполняемой работы, успеваемость, время, темп роста квалификации).
  2. Субъективные критерии (включают различные виды ответов, которые отражают отношение человека к чему-либо, его мнения, взгляды).
  3. Физиологический критерий (используется при изучении влияния внешней среды, влияющей на организм и психику).
  4. Критерий случайности (например, когда цель касается проблемы отбора для работы таких лиц, которые менее подвержены несчастным случаям).

Внешний критерий должен обладать 3 основными требованиями:

  1. Должен быть релевантным, то есть должна быть уверенность, что в критерии задействованы именно те особенности индивидуальной психики, которые измеряет диагностическая методика. Внешний критерий и диагностическая модель должны находиться во внутреннем смысловом соответствии.
  2. Должен быть свободным от помех (контаминации). Следует отбирать для исследования такие группы людей, которые находятся в более или менее одинаковых условиях.
  3. Должен быть надежен. Постоянство и устойчивость исследуемой функции.

Оценка валидности методики может носить количественный и качественный характер.

Для вычисления количественного показателя (коэффициента валидности) сопоставляются результаты, полученные при применении диагностических методик, с данными тех же лиц, полученные по внешнему критерию. Используются разные виды линейной корреляции (по Спирмену, по Пирсену).

Качественное описание сущности измеряемого свойства. Здесь не используют статистическую обработку.

Существуют несколько видов валидности , обусловленных особенностями диагностической методики, а также временным статусом внешнего критерия:

  1. Валидность «по содержанию» (используется в тестах достижения): 3 – 4 вопроса из большой темы могут показать истинные знания ученика. Для этого результаты диагностики сравнивают с экспертными оценками учителя.
  2. Валидность «по одновременности» или текущая валидность – собираются данные, относящиеся к настоящему времени: успеваемость, производительность и т.п. С ними коррелируют результаты успешности по тесту.
  3. «Предсказывающая» валидность («прогностическая»). Определяется по надежному внешнему критерию, но информация по нему собирается некоторое время спустя после испытания. Точность прогноза находится в обратной зависимости от времени, заданного для такого прогнозирования.
  4. «Ретроспективная» валидность. Определяется на основе критерия, отражающего события или состояние качества в прошлом. Может быть использована для быстрого получения сведений о предсказательных возможностях методики.