С развитием социальных сетей оказалось, что люди оставляют большое количество взаимосвязанных данных. Даже если профиль практически пустой, он может состоять в различных сообществах, иметь друзей, быть участником групп учебных заведений, города или организации.
Сам по себе ни один такой признак не позволяет уверенно определить личность. Однако совокупность множества совпадений позволяет вычислить вероятность того, что найденный профиль принадлежит именно искомому человеку.
Этот метод не является способом точной идентификации человека. Он представляет собой математическую модель ранжирования найденных профилей по степени похожести. Подобные идеи применяются в исследованиях социальных графов, рекомендательных системах и анализе открытых данных.
Первым признаком являются общие друзья.
Где:
Вторым важным признаком является участие в одинаковых сообществах.
Где:
Учебные заведения являются одним из наиболее информативных признаков. Для школьников дополнительно могут учитываться номер класса и его буква, так как они значительно уменьшают количество возможных совпадений.
где
Совпадение города увеличивает вероятность принадлежности профиля.
| L | Условие |
| 1.0 | Совпадает город |
| 0.5 | Совпадает регион |
| 0.0 | Не совпадает |
Не все сообщества одинаково информативны. Совпадение в группе с миллионом участников практически ничего не говорит, тогда как совпадение в небольшой группе выпускников конкретного класса может быть весьма значимым.
где
Социальную сеть можно представить в виде графа, где люди являются вершинами, а дружба - рёбрами.
где
Данный показатель рассматривается как дополнительный признак близости в социальной сети, а не как строгая вероятность.
Например:
С увеличением расстояния значение экспоненциально уменьшается.
Все признаки объединяются в одну итоговую оценку.
где
Вес редкости групп Wi может использоваться внутри расчёта Sg как дополнительное взвешивание (например, при подсчёте совпадений в сообществах), что повышает значимость малых и информативных групп.
Сумма всех коэффициентов wf, wg, we, wl равна 1.
Предположим, известно имя человека и город проживания. Поиск в социальной сети может вернуть десятки или сотни профилей. Для каждого найденного профиля вычисляются описанные выше показатели: совпадение друзей, участие в одинаковых сообществах, наличие одинакового учебного заведения и другие признаки.
После вычисления итоговой оценки все найденные профили сортируются по убыванию значения P. В верхней части списка оказываются профили, наиболее похожие на искомого человека по совокупности доступных открытых данных. Такой подход помогает ранжировать результаты поиска, но не доказывает, что конкретный профиль принадлежит определённому человеку.