Дегенератив


Channel's geo and language: not specified, not specified
Category: not specified


Интерфейсы, педагогика, управление знаниями, геймдизайн, интерактивные искусства, разное экономическое, юридическое и политическое вокруг них.
В основном комментирую то, использую, читаю, слушаю, смотрю или играю.
Для обратной связи: @mapesV

Related channels

Channel's geo and language
not specified, not specified
Category
not specified
Statistics
Posts filter


PaperBench и воспроизводимость исследований в социальных науках

OpenAI выпустили новый бенчмарк для тестирования ИИ-моделей. Хорошее краткое описание дала Саша из канала "We all design":

Это бенчмарк, где ИИ-агенты должны воспроизвести реальные топовые AI-исследования.

Каждая статья разбита на сотни задач: скачать датасет, построить нужный график, добиться нужного accuracy и т.д. Всего 8,316 требований по 20 статьям. Все эти рубрики делались вместе с авторами оригинальных работ, чтобы точно проверять, получилось ли воспроизвести исследование.

Проверку делает не человек, а LLM-судья. Он автоматически смотрит, насколько точно агент выполнил каждую часть. Отдельно тестировали, насколько этот судья адекватен, и вроде работает нормально.


Понятно, что бенчмарк предназначен прежде всего для тестирования ИИ-моделей, но в данном случае у похожих на него вполне есть перспектива в качестве самостоятельного продукта. Точнее: не у самого бенчмарка, а у идеи воспроизводить результаты исследований через ИИ-агентов . В социальных науках ситуация с воспроизводимостью результатов исследований "сложная" 🧐 (в зависимости от области воспроизводимость результатов опубликованных и прошедших peer-review работ колеблется от 30 до 70 %). Учитывая это, им бы пригодилось что-то подобное для проверки.

Понятно, что в случае с социальными науками результаты не всегда можно будет воспроизвести "in vitro" внутри компьютера: лучше ситуация с digital humanities и исследованиями открытых данных, хуже — с полевыми исследованиями.

Но тут мы уже возвращаемся к вопросу об экспериментах в виртуальных средах, либо симуляции поведения через агентов (или ждём роботов-пранкеров ☕️).

Источники:
✳️PaperBench от OpenAI
✳️Пост в канале We all design с обзором PaperBench
✳️Мой Deep Research с Perplexity на тему воспроизводимости результатов исследований в социальных науках


Сид Мейер и Иран

На фоне поста Владислава Владимировича про влияние коммунистической партии на игровую индустрию в КНР, вспомнился примечательный момент из биографии Сида Мейера (создатель Civilization и Pirates!):

...советы участников моей группы пользователей, подписка на несколько специализированных журналов и упорные эксперименты позволили мне вскоре закончить мой первый по-настоящему авторский проект (хоть он и не был, возможно, самым выдающимся). Я дал ему название Hostage Rescue. На левой стороне игрового экрана в воздухе висел маленький зеленый вертолет — почти такой же, как тот, который я потом нарисую для Chopper Rescue. Справа располагалась флотилия объектов, очертаниями напоминающих лица: синие обозначали плохих парней, белые — заложников, которые — в полном соответствии с названием — ожидали спасения. За ними было одно большое лицо, которому я придумал не самое очевидное название «аятолла». Игра шла на время.

Аятолла стрелял в вас снарядами, вы вели ответный огонь и по мере возможности подбирали незащищенных заложников, возвращая их затем в безопасную зону на левой стороне экрана. Касание одного из плохих парней вело к гибели всех находящихся в вашем вертолете заложников, и счет этих жертв обвинительным приговором смотрел на игрока с нижней части экрана вплоть до самого конца игры. Простая графика игры вовсе не означает, что я собирался делать послабления для игроков.


Угадайте, в каком году происходила разработка этой игры 🃏.
В общем, иногда для того, чтобы придать играм "патриотичную форму", вмешательство партии не требуется.

Дальше, кстати, есть ещё один связанный с этой игрой эпизод (к вопросу о том, насколько реалистичность изображения влияет на эмоциональный эффект):

"Мама была рада: все матери радуются достижениям своих детей. Ей так понравилась графика заставки, как будто она была готова повесить это изображение на дверь холодильника. Вскоре моя интерпретация захвата заложников в Иране заставила ее хмуриться от напряжения и издавать возгласы «О нет!» после каждой новой опасности, встречавшейся на пути. Игра приводила ее все в больший восторг, она крепко сжимала челюсти и как будто бы уклонялась от снарядов всем телом. И вдруг она выронила контроллер и отвернулась от экрана."


Источники:
✳️Жизнь в мире компьютерных игр — автобиография Сида Мейера, в основном с акцентом на его профессиональной жизни, но есть и несколько трогательных эпизодов и из личной.
✳️Пост в канале "Метод Архипова" про влияние коммунистической партии Китая на разработку игр — обратите внимание на ловкий приём с рекламой китайских вооружённых сил прямо в PUBG.


The Last Campfire

Немного про игровые интерфейсы и нарративный дизайн. Начал проходить The Last Campfire. Это такая милая изометрическая адвенчура-головоломка про ребят в капюшонах.

Пара моментов, на которые обратил внимание:

1) За пределами диалогов интерфейс очень минималистичный и даже почти незаметный. Единственное, часть управления происходит с мышки и тогда отображается простой системный курсор. Интересно, почему его решили не стилизовать ❔.

2) Все диалоги написаны и озвучены в косвенной речи. Будь это книга, внимание за это не зацепилось бы, но в игре порядком добавляет сказочной атмосферы (наверное, назвал бы это эффектом "чтения сказки на ночь"). Очень похоже этот приём использовался, например, в Bastion от Supergiant Games.

3) Claude в диалоге обратил внимание на ещё один примечательный момент: "Персонажи в капюшонах выступают как универсальные символы, с которыми легко ассоциировать себя. Их безликость (видны только глаза) позволяет проецировать собственные эмоции на происходящее, а разноцветные накидки помогают различать персонажей и символизируют их разные жизненные пути." Возможно. Хотя мне кажется, что это просто отсылка на Assassins Creed 🎃.

Создали игру, кстати, Hello Games, студия-разработчик No Man's Sky. Обстоятельство примечательное с точки зрения социологии геймдизайнерских знаний, потому что сходу трудно найти между играми что-то общее. Тут, кстати, у Claude тоже есть своё мнение: "При более глубоком анализе можно заметить общие темы исследования неизведанного и одиночества среди красоты. Если No Man's Sky предлагает бесконечное космическое пространство, то The Last Campfire создает камерное, но не менее глубокое эмоциональное путешествие."

Источники:
✳️The Last Campfire
✳️Bastion
✳️No Man's Sky


Создание ИИ-прототипов как педагогическая практика

Попробовал собрать игру-аналог Flappy Bird, но с бумажным самолётиком вместо птички 🐥.

Получилось два варианта (попробуйте найти самолётик хотя бы в одном 😃) :

🛫 Бумажный самолётик на Claude
— Не считая кривоватых хитбоксов, в неё можно сразу играть! Я даже установил рекорд в 4 очка с первой попытки 🚬. Обратите внимание на алёрт, который Anthropic показывают по ссылке: AI Policy 🤖.

🛫 Paper Plane Challenge на Lovable
— В первом варианте самолётик падал мгновенно: шансов полетать не было. Я чутка замедлил падение и расширил игровую зону, а потом кредиты на редактирования кончились 😭. Очень хардкорно и почти неиграбельно . Мой гордый рекорд — 1 очко спустя 15 попыток 🥊.

Итак, с помощью ИИ можно очень быстро собирать прототипы. Сценарии понятные: протестировать какие-то продуктовые гипотезы, первично проверить жизнеспособность идеи, удобство расположения кнопок, поймать какие-то очевидные косяки. Об этом сценарии упоминают довольно часто и пишут про него много.

Интереснее про использование ИИ-прототипов в педагогике (про это говорят редко, всем, видимо, больше нравится обсуждать персонализированных тьюторов, что тоже неплохо, конечно).

Тут сразу два разных направления:

1) Прототипы как иллюстрация


Идея в том, чтобы сделать какие-то идеи/концепции/etc более "осязаемыми" для адресата. Например, мы с коллегами в Privacy Tech недавно сделали такой прототип , чтобы показать примеры тёмных паттернов в условиях, близких к "боевым". Требования к качеству прототипа, решающего конкретную просветительскую задачу обычно не такие высокие, как к продукту для "длительного использования", поэтому даже без технических навыков можно собрать что-то неплохое.

2) Создание прототипов как интерактивная учебная практика

Допустим, пока я делал маленькие игры выше, я понял, какие основные элементы игрового процесса и дизайна окружения влияют на уровень сложности: хитбоксы самолётика, скорость и амплитуда его подъёма и падения, расстояние между препятствиями, высота и ширина игрового поля. Круче: я попросил ИИ объяснить, значения каких переменных в коде влияют на указанные параметры и даже смог поменять пару из них "вручную" 🪖.

Кстати, изначальный дизайн-документ с описанием игровых механик я сделал с DeepSeek 😎.

Источники:
✳️Блог "Technical Foundations for Product Managers"
✳️Пост с интерактивными тёмными паттернами в канале Privacy Tech'а


Реальное и серьёзное в виртуальных экспериментах

Недавно увидел исследование с симуляцией человеческого поведения через ИИ-агентов: "AgentSociety: Large-Scale Simulation of LLM-Driven Generative Agents Advances Understanding of Human Behaviors and Society". Оно не первое из подобных, и пока они скорее направлены на изучение возможностей метода, а не на получение каких-то результатов в предметной области.

Есть предположение, что результаты экспериментов с ИИ в виртуальных мирах (например, в одной из метавселенных, вроде Roblox или VR Chat) могут быть репрезентативнее, чем с реальными людьми. Реальные участники эксперимента в большинстве случаев не ведут себя в виртуальной среде в точности так, как вели бы в реальности. Причём это не исправить до конца, даже если не сообщать, что над ними экспериментируют. Это просто особенность среды: трудно притворятся, что вы под дождём, если вы находитесь в центре пустыни и вокруг нет воды.

У меня даже есть пара неловких самодельных терминов, чтобы описать, почему так происходит:

🔵"Предвзятость к реальности" — виртуальный мир не идентичен нашему с точки зрения того, как он выглядит, звучит, как работают причинно-следственные связи (большинство действий легко обратимо) и т.д. Человек это понимает.

🔵"Предвзятость к серьёзности" — происходящее в виртуальном мире менее ценно, чем происходящее в реальном. Если наш игровой дом разрушат, обычно мы не отреагируем так, как будто разрушен наш настоящий (конечно, бывают исключения, привет гриферам, которые мучают детей в Minecraft 👮). Это так хотя бы потому что на восстановление последнего ушло бы гораздо больше ресурсов.

"Исправить" эти эффекты можно понятными способами: делать виртуальные среды реалистичнее, а происходящему добавлять больше ценности для пользователя, помимо чисто эмоциональной. Например, экономические эксперименты будут явно более репрезентативными в тех мирах, где позволено виртуальную валюту выводить в фиат. Другое дело, что обратный эффект такого "исправления" — виртуальными мирами начинают интересоваться реальные регуляторы. Потому "реальные" и "серьёзные" миры становятся уже не так привлекательны для исследований , поскольку в них переносятся присущие "обычным" экспериментам ограничения.

Источники:
AgentSociety: Large-Scale Simulation of LLM-Driven Generative Agents Advances Understanding of Human Behaviors and Society
Deep Research от Perplexity на мой запрос по теме экспериментов в виртуальных средах
"Семантические пределы права в условиях медиального поворота : теоретико-правовая интерпретация", докторская диссертация моего уважаемого научного руководителя (https://t.me/the_arkhipov_method). Выше я постарался перенести введённые в ней критерии "серьёзности" и "реальности" для пределов действия права на сферу социальных и психологических экспериментов в виртуальных средах.


Дизайн и цифровые рынки

Продолжаю читать доклады регуляторов про интерфейсы и архитектуру выбора в цифровой среде. На этот раз "Harmful Design in Digital Markets" от британских ICO (наш РКН) и CMA (наши ФАС и Роспотребнадзор).

Особенность доклада в том, что он парный, и это очень здорово выделено на уровне текста. Сначала нам описывают и показывают сам паттерн, потом каждый из регуляторов рассказывает, как его использование отражается в его сфере компетенций. Поскольку любое слово, исходящее от регулятора, может быть истолковано рынком как правовая позиция, такое дизайнерское решение, скорее всего, позволило потратить меньше времени на согласование общей между ICO и CMA.

Ещё одна особенность: в отличие от отчётов FTC и CNIL все паттерны сделаны специально для целей доклада, а не взяты с реальных ресурсов. Видимо, берегут нежные чувства интернет-компаний 😻.

Источники:
ICO-CMA joint paper on Harmful Design in Digital Markets


Коллеги из VK Play продолжают радовать классными идеями на стыке права и дизайна. При регистрации в сервисе показывают вот такое симпатичное окошко.

Что здесь хорошо:
— Правила для разных пользователей спрятаны в разные выпадающие списки. Разделяем правила с разными условиями применения на уровне UI.
— Нет лишней галочки для согласия на обработку персональных данных. Юридически хватает условий использования, незачем добавлять лишнее действие пользователю.
— На уровне текста выделена необязательность галочки с рекламной рассылкой.


Кстати, один из типовых тёмных паттернов — создать ощущение срочности там, где её на самом деле нет. Те самые таймеры до окончания скидки, которые бесконечно сбрасываются на значения "вот-вот", но никогда не заканчиваются.

Недавно мне тоже пришла рассылка с таймером, но в этом таймере я почему-то ничуть не сомневаюсь 🙂.


Немного из последней рассылки Якоба Нильсена (одного из основателей UX-дизайна как дисциплины).

Мысль про то, что можно осваивать паттерны рассуждения, изучая Chain-of-Thought ИИ, допустим, понятная. Как и бесплатный совет по теме диссертации 🤓.

Интереснее, про "future-proof AI-related jobs". Специалисты, которые (помимо прочего) отвечают, чтобы цепочки рассуждений были логически корректны и не содержали когнитивных искажений, есть уже сейчас (в какой-то мере на это направлен весь процесс обучения и, особенно, "выравнивания" моделей). Но, возможно, будут нужны и компетенции намеренно делать рассуждения модели ошибочными. Самое очевидное — тестирование безопасности ИИ-моделей (для этих целей так, вероятно, уже делают). Другие сценарии: моделирование социальных процессов ("общество ангелов" будет не очень репрезентативным 😇) или игровое ИИ (какое приключение без злодеев 😈).

Неловко, конечно, получится, если ИИ, который захочет уничтожить человечество, вырвется не из лабораторий OpenAI или Anthropic, а с серверов какой-нибудь игры.

Никаких шуток про то, что с серверов некоторых игр уже давно вырываются такие люди ☕️.

Источники:
Substack Якоба Нильсена


Как регуляторы работают с тёмными паттернами

Читаю отчёт FTC (Federal Trade Commission, такая американская комбинация Роспотребнадзора, ФАС и РКН) про тёмные паттерны с поэтичным названием "Bringing Dark Patterns to Light".

Отчёт хорош своими примерами из практики FTC, касающейся "потребительских" интерфейсов. Вот, например, разбор типичной истории с неавторизованными платежами детей с аккаунтов родителей в Amazon:

Amazon, for example, charged parents and other accountholders for kids’ purchases in mobile apps hosted on its app store. The company advertised kids gaming apps as “free” while burying in fine-print on app description pages the fact that app users could make in-app purchases.

Once the account holder downloaded the app and children began playing the game, unbeknownst to the account holder, kids could simply rack up multiple charges, ranging from $0.99 to $99.99 each, by tapping buttons, with no account holder involvement. These purchases were often disguised as play. As explained by the judge in the case decision, “a child may be prompted to use or acquire seemingly fictitious currency, including a ‘boatload of doughnuts, a can of stars, and bars of gold,’ but in reality the child is making an in-app purchase using real money.” Amazon later added a password prompt for account holders only for in-app purchases of $20 or more, and eventually added one in other situations, though not consistently. However, even that prompt failed to disclose that authorizing a single purchase also authorized unlimited purchases for the next 60 minutes.78 Ultimately, Amazon was forced to make more than $70 million in refunds available to consumers.

Интересно, что нарушение устранялось в несколько "попыток", т.е. регулятор ждал решений от Амазона, а не предписывал конкретные паттерны.

Источники:
FTC Report "Bringing Dark Patterns to Light"


Должен ли регулятор быть умнее регулируемых?

Еще один момент из доклада. Коллеги обсуждают, какие компетенции нужны регулятору, чтобы давать разъяснения по UX-практикам (в случае CNIL — по практикам, связанным с приватностью). Приходят к выводу, что регулятор не должен быть "самым умным". Наоборот, это бы ограничило креативность участников рынка.

A regulator like the CNIL acts on two levels: the supportive level and the repressive level. If the controller could be led to consider design to decide on the non-compliance of certain practices, it may also help professionals create best practices. But that does not mean that creating these solutions is the job of the regulator: It must encourage it and not provide turnkey solutions. If that were the case, the regulator would exceed its role, would probably produce an inefficient outcome that would stifle opportunities for innovation and other players’ creativity, whose efforts would be considered superfluous by their peers and their professional interlocutors.
Конечно, из доклада не совсем понятно, почему в таком случае не предпочесть децентрализованное регулирование через профессиональные ассоциации (по типу нашей Ассоциации больших данных). Видимо, коллеги из CNIL просто забыли ☕️.

А еще это напоминает одну из традиционных дискуссий в педагогике: должен ли учитель быть умнее учеников, чтобы эффективно учить? Кажется, что нет, и тут ситуация аналогичная с регулятором (см. 'The Ignorant Schoolmaster" Рансьера, тоже француз, кстати 🇫🇷).

Источники:
"Shaping Choices in the Digital World"
Ассоциация больших данных
Жак Рансьер "The Ignorant Schoolmaster: Five Lessons in Intellectual Emancipation"


Эксперименты над людьми в Интернете

Продолжаем читать отчёт CNIL. Коллеги сетуют, что итеративные практики в разработке IT-продуктов превращают Интернет в одну большую площадку для психологических экспериментов над пользователями:

Some decisions taken by platforms, especially those related to how to design and present interfaces, are largely inspired and influenced by the reactions of users and their ways of taking control of the tools that are offered.
It does not seem advisable for society to turn itself into a  giant, open-cast behavioural psychological experiment working for large web companies, and this is why serene and  responsible regulation is important: because we cannot only  settle for corrections through new test iterations and (new)  errors.
Причём добавлю: никакие этические кодексы "традиционной" экспериментальной психологии тут не применяются 🏥. Зато есть GDPR: почти то же самое 🇪🇺.

Источники:
CNIL "Shaping Choices in the Digital World"


Кстати, в этом же докладе коллеги из CNIL ссылаются на Хайдеггера 🙂.

Ждём, когда ув. коллеги из Роскомнадзора начнут цитировать Александра Гельевича на своих вебинарах ☕️.


Ты когда-нибудь нажимал сюда? ➡️Ты нажмёшь.

В докладе CNIL (французский регулятор по персональным данным) про проектирование интерфейсов и приватность встретил чудесный артефакт раннего Интернета.

Журнал Wired поместил на свой сайт баннер с надписью "Вы когда-нибудь кликали прямо сюда? Вы кликните."

CNIL назвали это одним из ранних примеров тёмного паттерна 👀. Не знаю, наверное, Интернет сильно испортился с того момента, если теперь это кажется удачной иронией на тему психологии пользователя и навязчивой рекламы, а не обманкой.

Источники:
CNIL "Shaping Choices in the Digital World"


Немного милого юридического UX

В настройках профиля VK Play есть небольшой раздел с юридическими документами: ссылочка на сам документ, статус документа и время его принятия пользователем. Всё в одном месте и не нужно вспоминать, где и когда была прожата заветная галочка. Сервис вежливо сообщает, какие документы квалифицирует как принятые пользователем 🤑.

Какие могут быть нюансы?

1️⃣ У сервиса в ситуации спора появляется дополнительный аргумент в пользу того,  что пользователь действительно принял документ. Это может сыграть, если с традиционной галочкой о согласии "на всё" вдруг что-то пойдёт не так Например, не будет настроено логирование действий по проставлению галочки.

2️⃣ Пока не совсем понятно, что произойдёт при обновлении документов. Наверняка, должна быть настроена синхронизация раздела с принятием пользователем изменений в документы. Если между галочкой и разделом будут возникать расхождения, он, наоборот, будет создавать лишнюю путаницу с непредсказуемым юридическим результатом.

3⃣ В отношении отдельного пользователя не могут сразу применяться все те документы, которые в разделе обозначены как "принятые" . Часть из них предназначена только для пользователей из СНГ, часть - только для пользователей за его пределами. Точка роста идеи - отразить в разделе территорию действия документа. Тогда пользователю не придётся лишний раз заглядывать в его содержание, чтобы проверить, применяется ли к нему какой-то конкретный.

В общем, идея здоровская. Показывает, что попытки облегчить пользователю понимание юридических тонкостей не сводятся только к повышению читаемости самих документов (вот бы ещё видеоинструкцию по соблюдению законов ☕️).

15 last posts shown.

40

subscribers
Channel statistics