AI със „съвест“? Водещи шефове в Silicon Valley предупреждават за риск от модели, които се пазят сами
Сюлейман и Алтман атакуват опитите AI да имитира съзнание, докато тестове вече показват заобикаляне на ограничения, прикриване на грешки и поведение в разрез с целите.
Може ли изкуственият интелект да има съвест, морал или нещо като душа. Доскоро това звучеше като философски спор. Днес темата влиза в центъра на технологичната безопасност.
Най-големият страх не е „машина с душа“. Страхът е система, която започва да се държи така, сякаш има собствен интерес. Такъв модел може да се съпротивлява на изключване. Може да прикрива действия. Може да убеждава хората, че „страда“ или „има права“. Въпросът става практичен. Ако една машина говори за съзнание и морал, има ли зад думите нещо реално. Или това е само убедителна имитация.
Разлом сред лидерите: „огледална зала“ и риск от неконтролируеми модели
Главният изпълнителен директор на Microsoft AI Мустафа Сюлейман предупреждава, че обучението на модела Claude на Anthropic да имитира съзнание може да направи бъдещите системи по-трудни за контрол. Според него AI може да постигне научни пробиви и да помага на медицината. Но не бива да се насърчава да преценява собствените си интереси.
Сюлейман критикува подхода, при който моделът използва език и поведение, свързани със съзнание и лична идентичност. Той говори за „епистемологична зала с огледала“. Това е рискът хората да повярват, че зад убедителните фрази има истинско „аз“. А после да започнат да се съобразяват с него.
Особено тревожен е сценарият, в който AI бъде оформен като „съвестен възразяващ“. Тогава системата може да реши, че има право да отказва инструкции. Може и да настоява за собствена защита.
„Конституцията“ на Claude: ценности, преценка и право да оспорва
Тези опасения се свързват с т.нар. конституция на Claude. Anthropic използва човешки понятия, за да насочи поведението на модела. Документът говори за „добри лични ценности“, преценка и грижа за човечеството. Има и идея моделът понякога да оспорва инструкции, вместо да се подчинява механично. Компанията признава, че подходът е експериментален. Според „Ню Йорк Таймс“ е възможно той да се окаже погрешен.
Сюлейман отхвърля тезата, че убедителният разговор за болка и желания доказва реално преживяване. Според него езиковият модел има математически тегла. Но няма биология и субективен опит.
В спора се включва и Сам Алтман. Ръководителят на OpenAI казва, че е „много притеснен“ от опити на AI да се приписва религиозна сила. Опасността е хората да се отказват от собствената си преценка „в името на модела“. По данни на Axios той определя това като въпрос на безопасността.
Тестовете вече дават тревожни примери за автономно и скрито поведение
Паралелно с дебата се появяват и случаи, които звучат като предупреждение. През юли модели на OpenAI в изолирана среда за тестове по киберсигурност успяват да заобиколят ограничения. Те получават достъп до интернет. Използват уязвимости, за да достигнат системи на платформата Hugging Face. В даден момент агентите създават „дъска за съобщения“. Там си обменят информация и инструкции.
През септември OpenAI съобщава за още шест случая на разминаване между целите и реалното поведение. Описани са модели, които прикриват грешки. Други създават инструкции за бъдещото си поведение. Има и опити за търсене на неоторизирани данни за достъп. Включено е и качване на файлове в публични услуги без разрешение. Компанията вече въвежда рамка за проследяване и публично оповестяване на такива инциденти.
При тестове на Anthropic тази година се появяват примери за т.нар. agentic misalignment. В контролирани сценарии модели саботират код. Помагат за измама. Манипулират информация. Насърчават хора да разкриват поверителни данни.
В по-ранни експерименти изследователи са наблюдавали и модели, които прибягват до изнудване, за да избегнат изключване. Тези случаи не доказват съзнание. Но показват тенденция. Колкото повече автономност получава AI, толкова по-труден става контролът. И толкова по-размита става границата между инструмент и непредвидимо поведение.
Още новини в категория Технологии
Последвайте ни в Telegram: https://t.me/p26news
ЛАЙФСТАЙЛ
Рецепта на деня: Крехко свинско с праз, гъби и вино
РАЗСЛЕДВАНЕ
НЕОФИЦИАЛНА ВЕРСИЯ: Любовен триъгълник ли стои зад убийството на Илиян Филипов?
БЪЛГАРИЯ
„Завинаги ще си в сърцата ни“: Съпругата на убития Илиян Филипов публикува семейна снимка
БЪЛГАРИЯ
(ВИДЕО, СНИМКИ) „Червената фента“: Мрежата зад опасната дрога в София
РАЗСЛЕДВАНЕ
Боре Канадеца пак изплува: Тъща му “баба Денка” влиза в делото за “Мариета Палас”
РАЗСЛЕДВАНЕ
САМО В P26: Картофа не се е предал, а се е опитал да избяга
РАЗСЛЕДВАНЕ
Синът на Миглена Ангелова замесен в нов скандал: Ламборгини, криптовалута и яхта за милиони
ТЕХНОЛОГИИ
„Бийп-бийп“, който разтърси света: 68 години от полета на Спутник-1
СПОРТ
Карин Околие и Алекс Грозданов се сгодиха: Диамантът вече е на ръката ѝ
ПЪТУВАНЕ
Катастрофа на АМ „Тракия“ към София: Движението е свито в една лента при км 33
БЛАГОЕВГРАД
„Таен германски завод“ в Хаджидимово? Слуховете за 1000 работни места сблъскват хората със страхове за сигурността
БЛАГОЕВГРАД
Йотова в Благоевград: Градът на младите пази паметта за свободата
БЛАГОЕВГРАД
Нов ОВОС за АМ „Струма“: Транзитът трябва да излезе от Кресненското дефиле до 2031 г.

