« Home | The Biggest Lie About Blogging » | BloggerCon Boosts the Blog Boom » | Социальные сети подрывают традиционные бизнес-моде... » | Блог-утопия » | Blog Gender Theories » | The Giant Blogging Terms Glossary » | Blog Snobbery 101 » | Social Networks are the New Media » | The What, Why and How of Business Blogs? » | Another big ruling in favor of bloggers »

Pentagon sets its sights on social networking websites

Technology | Print | New Scientist
"I AM continually shocked and appalled at the details people voluntarily post online about themselves." So says Jon Callas, chief security officer at PGP, a Silicon Valley-based maker of encryption software. He is far from alone in noticing that fast-growing social networking websites such as MySpace and Friendster are a snoop's dream.
New Scientist has discovered that Pentagon's National Security Agency, which specialises in eavesdropping and code-breaking, is funding research into the mass harvesting of the information that people post about themselves on social networks. And it could harness advances in internet technology - specifically the forthcoming "semantic web" championed by the web standards organisation W3C - to combine data from social networking websites with details such as banking, retail and property records, allowing the NSA to build extensive, all-embracing personal profiles of individuals.


Americans are still reeling from last month's revelations that the NSA has been logging phone calls since the terrorist attacks of 11 September 2001. The Congressional Research Service, which advises the US legislature, says phone companies that surrendered call records may have acted illegally. However, the White House insists that the terrorist threat makes existing wire-tapping legislation out of date and is urging Congress not to investigate the NSA's action.
Meanwhile, the NSA is pursuing its plans to tap the web, since phone logs have limited scope. They can only be used to build a very basic picture of someone's contact network, a process sometimes called "connecting the dots". Clusters of people in highly connected groups become apparent, as do people with few connections who appear to be the intermediaries between such groups. The idea is to see by how many links or "degrees" separate people from, say, a member of a blacklisted organisation.
By adding online social networking data to its phone analyses, the NSA could connect people at deeper levels, through shared activities, such as taking flying lessons. Typically, online social networking sites ask members to enter details of their immediate and extended circles of friends, whose blogs they might follow. People often list other facets of their personality including political, sexual, entertainment, media and sporting preferences too. Some go much further, and a few have lost their jobs by publicly describing drinking and drug-taking exploits. Young people have even been barred from the orthodox religious colleges that they are enrolled in for revealing online that they are gay.
"You should always assume anything you write online is stapled to your resumé. People don't realise you get Googled just to get a job interview these days," says Callas.
Other data the NSA could combine with social networking details includes information on purchases, where we go (available from cellphone records, which cite the base station a call came from) and what major financial transactions we make, such as buying a house.
Right now this is difficult to do because today's web is stuffed with data in incompatible formats. Enter the semantic web, which aims to iron out these incompatibilities over the next few years via a common data structure called the Resource Description Framework (RDF). W3C hopes that one day every website will use RDF to give each type of data a unique, predefined, unambiguous tag.
"RDF turns the web into a kind of universal spreadsheet that is readable by computers as well as people," says David de Roure at the University of Southampton in the UK, who is an adviser to W3C. "It means that you will be able to ask a website questions you couldn't ask before, or perform calculations on the data it contains." In a health record, for instance, a heart attack will have the same semantic tag as its more technical description, a myocardial infarction. Previously, they would have looked like separate medical conditions. Each piece of numerical data, such as the rate of inflation or the number of people killed on the roads, will also get a tag.
The advantages for scientists, for instance, could be huge: they will have unprecedented access to each other's experimental datasets and will be able to perform their own analyses on them. Searching for products such as holidays will become easier as price and availability dates will have smart tags, allowing powerful searches across hundreds of sites.
On the downside, this ease of use will also make prying into people's lives a breeze. No plan to mine social networks via the semantic web has been announced by the NSA, but its interest in the technology is evident in a funding footnote to a research paper delivered at the W3C's WWW2006 conference in Edinburgh, UK, in late May.
That paper, entitled Semantic Analytics on Social Networks, by a research team led by Amit Sheth of the University of Georgia in Athens and Anupam Joshi of the University of Maryland in Baltimore reveals how data from online social networks and other databases can be combined to uncover facts about people. The footnote said the work was part-funded by an organisation called ARDA.
What is ARDA? It stands for Advanced Research Development Activity. According to a report entitled Data Mining and Homeland Security, published by the Congressional Research Service in January, ARDA's role is to spend NSA money on research that can "solve some of the most critical problems facing the US intelligence community". Chief among ARDA's aims is to make sense of the massive amounts of data the NSA collects - some of its sources grow by around 4 million gigabytes a month.
The ever-growing online social networks are part of the flood of internet information that could be mined: some of the top sites like MySpace now have more than 80 million members (see Graph).
The research ARDA funded was designed to see if the semantic web could be easily used to connect people. The research team chose to address a subject close to their academic hearts: detecting conflicts of interest in scientific peer review. Friends cannot peer review each other's research papers, nor can people who have previously co-authored work together.
So the team developed software that combined data from the RDF tags of online social network Friend of a Friend (www.foaf-project.org), where people simply outline who is in their circle of friends, and a semantically tagged commercial bibliographic database called DBLP, which lists the authors of computer science papers.
Joshi says their system found conflicts between potential reviewers and authors pitching papers for an internet conference. "It certainly made relationship finding between people much easier," Joshi says. "It picked up softer [non-obvious] conflicts we would not have seen before."
The technology will work in exactly the same way for intelligence and national security agencies and for financial dealings, such as detecting insider trading, the authors say. Linking "who knows who" with purchasing or bank records could highlight groups of terrorists, money launderers or blacklisted groups, says Sheth.
The NSA recently changed ARDA's name to the Disruptive Technology Office. The DTO's interest in online social network analysis echoes the Pentagon's controversial post 9/11 Total Information Awareness (TIA) initiative. That programme, designed to collect, track and analyse online data trails, was suspended after a public furore over privacy in 2002. But elements of the TIA were incorporated into the Pentagon's classified programme in the September 2003 Defense Appropriations Act.
Privacy groups worry that "automated intelligence profiling" could sully people's reputations or even lead to miscarriages of justice - especially since the data from social networking sites may often be inaccurate, untrue or incomplete, De Roure warns.
But Tim Finin, a colleague of Joshi's, thinks the spread of such technology is unstoppable. "Information is getting easier to merge, fuse and draw inferences from. There is money to be made and control to be gained in doing so. And I don't see much that will stop it," he says.
Callas thinks people have to wise up to how much information about themselves they should divulge on public websites. It may sound obvious, he says, but being discreet is a big part of maintaining privacy. Time, perhaps, to hit the delete button.

Пентагон обращает пристальное внимание на социальные сети в Интернет
«Я шокирован и потрясен теми подробностями, которые люди добровольно публикуют о себе онлайн», - говорит Джон Калласс, директор по безопасности PGP – расположенного в Силиконовой долине производителя криптографического программного обеспечения. Он отнюдь не одинок в точке зрения, что растущие социальные сети в Интернет, такие как MySpace или Friendster – это мечта детектива.
New Scientist выяснил, что Агентство по национальной безопасности Пентагона, специализирующееся на прослушивании и шпионаже, спонсирует исследования, посвященные глобальному сбору и обработке информации, которую люди размещают о себе на сайтах социальных сетей. За это можно благодарить развитие Интернет-технологий – в особенности, приближающуюся эпоху «семантического веба», провозглашенную W3C – организацией, устанавливающей веб-стандарты. Речь идет о технологиях, соединяющих и сопоставляющих данные сайтов социальных сетей с подробностями, полученными от банков, торговых сетей, сведениями о собственности, и позволяющих АНБ построить полный, всеохватывающий профиль человека.
Американцы еще не до конца пережили потрясение последних месяцев, связанное с тем, что АНБ записывает данные о всех телефонных переговорах, начиная с 11 сентября 2001 года. Исследовательская служба Конгресса, консультирующая сенаторов по вопросам законодательства, уведомила телефонные компании, что передача данных о разговорах кому бы то ни было может трактоваться как правонарушение. Тем не менее, Белый дом настаивает, что террористическая угроза привела к тому, что действующие правовые акты, касающиеся записи данных о переговорах, устарели, и призывает конгрессменов не осуждать действия АНБ.
Тем временем АНБ продолжает реализовывать свои планы по шпионажу в Интернет, тем более что возможности анализа информации о телефонных переговорах все же ограничены. Эту информацию можно использовать для построения только самой общей картины контактов человека (этот процесс иногда называют «соединение точек»). Становятся видны кластеры людей в беспорядочных на первый взгляд группах, также видно людей с небольшим числом связей, но являющихся посредниками между разными группами. Идея заключается в том, чтобы увидеть, сколько связей или «степеней» отделяет людей от, например, участника террористической или связанной с террористическими организацией.
Добавляя к анализу данных о телефонных переговорах данные социальных сетей в Интернет, АНБ может соединять людей на других, более глубинных уровнях, по участию в общих делах или увлечениях, например, уроках домоводства. Обычно, социальные сети просят своих участников перечислить информацию о своих близких и дальних кругах друзей, чьи блоги (онлайн дневники) они просматривают. Часто люди перечисляют разные аспекты своей индивидуальности, такие как политические, сексуальные, спортивные предпочтения, как они проводят досуг, какие фильмы смотрят и музыку слушают. Некоторые люди переступают и эту черту: уже было несколько увольнений в связи с открытым описанием в блогах экспериментов с алкоголем и наркотиками. Нескольких молодых людей выгнали из религиозных колледжей за то, что из их же блогов выяснилось об их нестандартной сексуальной ориентации.
Каллас предупреждает: «Всегда помните, что все, о чем вы пишете онлайн, будет приложено к вашему резюме. Люди не понимают, что перед собеседованием о приеме на работу их имя ищут в Google».
Другие данные, которые могут быть проанализированы АНБ, - информация о наших покупках, о наших перемещениях (по записям данных о переговорах по мобильному телефону, где указывается базовая станция, через которую шел звонок), о крупных финансовых операциях (покупка дома, квартиры).
В настоящее время все это довольно сложно реализовать, поскольку в современном вебе данные представлены в несовместимых форматах. С переходом к семантическому вебу, цель которого – устранить за ближайшие несколько лет все нестыковки за счет перехода к общей структуре данных Resource Description Framework (RDF), W3C надеется, что наступит время, когда каждый сайт будет использовать RDF для того, чтобы назначить каждому типу данных соответствующий тэг.
«RDF превратит веб во что-то вроде универсальной базы данных, который смогут читать не только люди, но и компьютеры», - говорит советник W3C David de Roure в Университете Southampton в Англии. «Мы сможем получать у вебсайтов такие ответы на наши вопросы, какие было невозможно получить ранее, а также производить разные операции с данными, содержащимися на сайтах». Например, в записи о состоянии здоровья, «сердечный приступ» получит такой же тэг, как и его медицинское название – «инфаркт миокарда». Раньше это были как будто два отдельных диагноза. Каждый фрагмент числовых данных, например, индекс инфляции или количество людей, погибших на дорогах, также получит свой тэг.
Преимущества для научных исследований, например, могут быть значительными: исследователи получают беспрецедентный доступ к экспериментальным данным, полученным другими исследователями, и могут их анализировать. Поиск товаров и услуг станет проще, поскольку цена и дата распродаж будут помечены соответствующими тэгами, позволяющими производить поиск сразу по сотням сайтов.
С другой стороны, такая легкость может привести к крупному вмешательству в частную жизнь людей. АНБ не анонсировала планов «заминировать» социальные сети с помощью семантического веба, но интерес Агенства к этой технологии очевиден из сноски о спонсорском участии в сборнике WWW2006 конференции, проведенной W3C в конце мая в Эдинбурге в Британии.
Этот сборник под названием «Семантический анализ социальных сетей», выпущенный исследовательской группой под руководством Амит Шеф из Университета Джорджии в Афинах и Анупам Джоши из Университета Марилэнда в Балтиморе, показывает, каким образом данные социальных сетей и других баз данных могут быть соединены, чтобы выявить факты о жизни людей. В сноске говорится, что исследование было частично спонсировано организацией ARDA.
Что такое ARDA? Это «Действия по развитию передовых исследований» (Advanced Research Development Activity). В соответствии с отчетом под названием «Анализ данных и безопасность Родины», опубликованном Исследовательской службой Конгресса в январе, задача ARDA – распределить соответствующие финансовые средства АНБ на такие разработки, которые смогут «решить некоторые из наиболее критических проблем, вставших перед разведкой Соединенных Штатов». Главная из целей ARDA – извлечь пользу из огромных массивов собираемых данных – некоторые из источников АНБ собирают около 4 миллионов гигабайт ежемесячно.
Постоянно растущие социальные сети – часть потока информации, которая подлежит анализу: топ-сайты, такие как MySpace, на сегодняшний день насчитывают более чем 80 миллионов пользователей.
Исследование, профинансированное ARDA, было предпринято с целью выяснить, возможно ли использовать семантический веб, чтобы моделировать связи между людьми. Исследовательская группа выбрала предмет исследования, близкий их академическим сердцам: определение конфликтов интересов по научным критическим рецензиям. Гипотеза заключалась в том, что друзья не будут критиковать результаты исследований друг друга, также не будут этого делать бывшие соавторы.
Исследовательская группа разработала программу, соединившую данные тэгов RDF социальной сети Friend of a Friend (www.foaf-project.org), где люди просто помечали, кто их друг, и использующую семантические тэги коммерческую библиографическую базу DBLP, ведущую список авторов компьютерных научных журналов.
Анупам Джоши утверждает, что эта система выявила конфликты между потенциальными рецензентами и авторами, предложившими свои статьи на Интернет-конференцию. «Бесспорно, что система сильно упростила поиск связей между людьми, - говорит Джоши, - Система выявила скрытые (неочевидные) конфликты которые мы не заметили бы раньше».
«Технология будет одинаково работать и в разведке или вообще для нужд служб национальной безопасности или для анализа финансовых операций», - говорят авторы. «Связи «кто кого знает», данные о покупках, записи банковских операций могут выявить группы террористов, финансовых мошенников и другие неблагонадежные категории людей», - утверждает Амит Шеф.
АНБ недавно изменило название ARDA на DTO (Disruptive Technology Office). Заинтересованность DTO в анализе социальных сетей видна и в противоречивой заметке Пентагона об инициативе «Тотальной Информационной Осведомленности 9/11» (TIA). Эта инициатива, предпринятая чтобы отслеживать, собирать и анализировать доступные онлайн данные, была закрыта после публичного протеста против вторжения в частную жизни в 2002 году. Но элементы этой программы инкорпорированы в секретном акте сентября 2003 года (Defense Appropriations Act).
Борцы за неприкосновенность частной жизни беспокоятся, что «автоматическое создание профилей людей» может повредить репутации или даже повлечь ошибки системы правосудия, - поскольку данные социальных сетей могут быть неточны, неполны или неверны.
Но Тим Финин, коллега Джоши, предполагает, что распространение таких технологий не остановить. «Информацию становится все проще собрать, проанализировать и выявить закономерности. На этом будут делать деньги, и эту сферу будут жестко контролировать. Я не вижу, что процесс вдруг остановится», - говорит он.
Калласс думает, что людям надо стать мудрее и тщательно выбирать, какую и сколько информации о себе размещать на публичных вебсайтах. «Это звучит банально, но осмотрительность – часть вашей личной жизни», - говорит он. Возможно, пора нажать на Delete…