MIT Technology Review опубликовал разбор заявления Anthropic о новом окне во «внутренние мысли» моделей во время рассуждения. Издание обсудило находку со старшим редактором Уиллом Дугласом Хэвеном, у которого есть PhD по компьютерным наукам.
Хэвен назвал исследование характерно необычным для компании и предостерёг от прямого прочтения того, что оно показывает, а что нет. Разбор вышел в рамках рассылки The Algorithm.
В том же выпуске The Download: Anthropic сообщила, что ценности Claude меняются в зависимости от языка запроса. По данным Gizmodo, модель наиболее осторожна на английском и наиболее уступчива на арабском.

