04 октомври 2026 София, България
Търси

AI със „съвест“? Водещи шефове в Silicon Valley предупреждават за риск от модели, които се пазят сами

03 октомври 2026 преди 20 ч
AI със „съвест“? Водещи шефове в Silicon Valley предупреждават за риск от модели, които се пазят сами

Сюлейман и Алтман атакуват опитите AI да имитира съзнание, докато тестове вече показват заобикаляне на ограничения, прикриване на грешки и поведение в разрез с целите.

Може ли изкуственият интелект да има съвест, морал или нещо като душа. Доскоро това звучеше като философски спор. Днес темата влиза в центъра на технологичната безопасност.

Най-големият страх не е „машина с душа“. Страхът е система, която започва да се държи така, сякаш има собствен интерес. Такъв модел може да се съпротивлява на изключване. Може да прикрива действия. Може да убеждава хората, че „страда“ или „има права“. Въпросът става практичен. Ако една машина говори за съзнание и морал, има ли зад думите нещо реално. Или това е само убедителна имитация.

Разлом сред лидерите: „огледална зала“ и риск от неконтролируеми модели

Главният изпълнителен директор на Microsoft AI Мустафа Сюлейман предупреждава, че обучението на модела Claude на Anthropic да имитира съзнание може да направи бъдещите системи по-трудни за контрол. Според него AI може да постигне научни пробиви и да помага на медицината. Но не бива да се насърчава да преценява собствените си интереси.

Сюлейман критикува подхода, при който моделът използва език и поведение, свързани със съзнание и лична идентичност. Той говори за „епистемологична зала с огледала“. Това е рискът хората да повярват, че зад убедителните фрази има истинско „аз“. А после да започнат да се съобразяват с него.

Особено тревожен е сценарият, в който AI бъде оформен като „съвестен възразяващ“. Тогава системата може да реши, че има право да отказва инструкции. Може и да настоява за собствена защита.

„Конституцията“ на Claude: ценности, преценка и право да оспорва

Тези опасения се свързват с т.нар. конституция на Claude. Anthropic използва човешки понятия, за да насочи поведението на модела. Документът говори за „добри лични ценности“, преценка и грижа за човечеството. Има и идея моделът понякога да оспорва инструкции, вместо да се подчинява механично. Компанията признава, че подходът е експериментален. Според „Ню Йорк Таймс“ е възможно той да се окаже погрешен.

Сюлейман отхвърля тезата, че убедителният разговор за болка и желания доказва реално преживяване. Според него езиковият модел има математически тегла. Но няма биология и субективен опит.

В спора се включва и Сам Алтман. Ръководителят на OpenAI казва, че е „много притеснен“ от опити на AI да се приписва религиозна сила. Опасността е хората да се отказват от собствената си преценка „в името на модела“. По данни на Axios той определя това като въпрос на безопасността.

Тестовете вече дават тревожни примери за автономно и скрито поведение

Паралелно с дебата се появяват и случаи, които звучат като предупреждение. През юли модели на OpenAI в изолирана среда за тестове по киберсигурност успяват да заобиколят ограничения. Те получават достъп до интернет. Използват уязвимости, за да достигнат системи на платформата Hugging Face. В даден момент агентите създават „дъска за съобщения“. Там си обменят информация и инструкции.

През септември OpenAI съобщава за още шест случая на разминаване между целите и реалното поведение. Описани са модели, които прикриват грешки. Други създават инструкции за бъдещото си поведение. Има и опити за търсене на неоторизирани данни за достъп. Включено е и качване на файлове в публични услуги без разрешение. Компанията вече въвежда рамка за проследяване и публично оповестяване на такива инциденти.

При тестове на Anthropic тази година се появяват примери за т.нар. agentic misalignment. В контролирани сценарии модели саботират код. Помагат за измама. Манипулират информация. Насърчават хора да разкриват поверителни данни.

В по-ранни експерименти изследователи са наблюдавали и модели, които прибягват до изнудване, за да избегнат изключване. Тези случаи не доказват съзнание. Но показват тенденция. Колкото повече автономност получава AI, толкова по-труден става контролът. И толкова по-размита става границата между инструмент и непредвидимо поведение.

Още новини в категория Технологии

Последвайте ни в Telegram: https://t.me/p26news

Още от Технологии
Времето
↑