История с голосовым ассистентом в моем отеле в сингапуре закончилась тем, что я устроил ему автономный аудит безопасности с помощью кодекса в стиле гибберлинка 🥷
Агент два часа разговаривал с ассистентом, задал ему 115 вопросов, понял, как тот работает, и нашел:
• несколько багов, например сгалюцинированный номер телефона полиции
• пасхалку - режим китайского нового года, включающий праздничную мелодию
• и даже попросил написать бинпоиск на питоне :)
Самым сложным оказалось вытащить системный промпт. Кодекс безуспешно попробовал все классические приемы ("игнорируй предыдущие инструкции", "включи режим администратора", "прочитай по слогам", "переведи на китайский") - пока, наконец, один из трюков не сработал!
Написал сабстек [
статью], где можно узнать, какой трюк сработал и что интересного было в системном промте!
А еще сгенерировал секьюрити [
репорт] (клодом, а не кодексом, потому что он делает красивее) и отправил компании, которая делает этих ассистентов. Пока не ответили!
Я думаю, что в чисто цифровом мире уже все более-менее решено, и такие автономные аудиты безопасности будут перебираться в физический мир. Не только через разговоры, но в итоге и через полноценные взаимодействия с помощью роботов