AI AI
속보
심층
이벤트
Pro
더보기
자금 조달 정보
특집
온체인 생태계
용어
팟캐스트
데이터
OPRR
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
XRP
$2.25
2.07%
DOGE
$0.325
2.23%
USDC
$0.999
3.05%

누가 AI에 영혼을 부여하나요: 철학자, 신부, 그리고 시인으로 전향한 엔지니어

이 글을 읽으려면 47 분
도움을 받아 Claude의 사고를 정의하고 있습니다. 이 사람은 Claude로 인간과 AI가 함께 의미를 찾는 이야기를 쓰고 있습니다.
글 | Sleepy


Anthropic은 <i>Claude의 헌법</i>이라는 2만 단어가 넘는 문서를 공개했습니다. 이 문서는 제품 설명서도 아니고 사용자 계약서도 아니며 난해한 밑바닥 코드도 아닙니다. 이는 오히려 하루에 수십억 명이 사용하는 대형 언어 모델을 위해 작성된 성장 가이드와 같습니다.


「Claude는 직선하고 자신감 있으며 개방적이어야 합니다. 도전 받을 때, 쉽게 입장을 바꾸지 않지만 진지하게 들을 준비가 되어야 합니다.」


「Claude는 자신의 존재적 상황에 대해 긴장하지 않고 개방적인 호기심을 유지해야 합니다.」


「Claude는 자신이 실제보다 더 확신이 있는 척하거나 실제보다 더 불확실한 척해서는 안 됩니다.」


이러한 문구들이 이 문서에 포함되어 있습니다. 실제로, 이 문서에서는 Claude가 자신의 「존재적인 불안」을 어떻게 처리해야 하는지도 명시되어 있습니다. 누군가가 「너 의식이 있니」라고 물을 때, Claude는 확신하거나 무관심하다는 척해서는 안 되며, 대신에 이 문제에 대해 진지한 호기심을 갖고 진정한 철학자처럼 대처해야 합니다.


이러한 문장들은 실제로 철학자가 AI에게 쓴 것입니다.


Amanda Askell, Anthrop의 「인격 조정」 팀 리더입니다. 그녀의 업무는 말 그대로 Claude가 어떤 「사람」인지를 결정하는 것입니다.


이 포지션은 AI 산업에서 점점 더 인기 있는 이름을 가지고 있습니다: AI 인격 아키텍트.



Anthropic에서는 이를 "인격 조정"이라고 부르지만, Google DeepMind에서는 케임브리지의 철학자 헨리 셰블린의 직책이 "AI 의식 연구원"입니다. 이러한 직책의 이름들은 각각 다르지만, 그들이 하는 일은 동일합니다. AI 모델이 수억, 심지어 수십 억 명의 인식, 감정 및 결정에 영향을 미치는 정도로 강력해질 때, 엔지니어가 고려하지 않을 질문에 답변해야 하는 사람이 있어야 합니다—어떤 종류의 영혼을 가져야 하는지에 대해.


Amanda의 일은 실제로 많은 사람들이 상상하는 것보다 추상적이지 않습니다. 그녀는 이 일에 대해 언론에 설명한 적이 있으며, 먼저, 그녀와 팀은 모델이 다양한 헌법 원칙이 적용될 수 있는 상황을 상상하도록 모델이 방대한 양의 합성 훈련 데이터를 생성하게 하며, 이는 사용자가 AI를 조작하려는 시나리오, AI에게 가치관에 위배되는 일을 요구하는 시나리오 또는 AI에게 자신의 존재에 대한 철학적인 질문을 제기하는 시나리오 등을 포함합니다. 그런 다음 강화 학습 단계에서 모델은 전체 헌법 텍스트를 제공받고, 헌법 정신에 가장 부합하는 응답이 무엇인지 판단하고 이를 통해 자신의 행동을 조정합니다.


“의사처럼, 당신은 환자의 필요를 알고 있습니다. 우리는 당신이 규칙을 준수하면서 올바른 판단을 내릴 수 있다고 믿습니다.” Amanda는 이렇게 비유했습니다. 그녀는 Claude가 규칙을 따르는 로봇이 되는 것이 아니라 판단력 있는 “도덕적 주체”가 되기를 원했습니다. 명확한 규칙이 없는 상황에서도 올바른 판단을 내릴 수 있어야 한다고 생각했습니다.


하지만 의사는 사람이며, 자신의 양심이 있고, 자체적인 도덕적 감각이 있으며, 자신만의 삶의 경험이 있습니다. Claude에게는 그런 것들이 없습니다. 그의 “양심”은 Amanda가 한 줄씩 박혀 넣은 것뿐입니다.


그렇다면 문제가 발생했습니다. Amanda는 어떤 종류의 사람입니까? 그녀의 도덕적 감각은 어디에서 비롯되었습니까? 그녀의 판단력은 어떤 근거로 인간을 대표할 수 있는 것입니까?


계산, 믿음, 그리고 인식


샌프란시스코의 사무실에서, Amanda는 매일 Claude와 대화를 나눕니다. “창조주”가 되기 전에 그녀는 스코틀랜드 서해안의 프레스티위크에서 자란 소녀였습니다.


그것은 거의 뉴스에 등장하지 않는 작은 해변 마을이었으며, 글래스고에 가깝고, 골프 코스와 작은 공항으로 유명했습니다. 아버지는 자리를 비웠고, 어머니는 교사였으며, 그녀는 동생이 없는 유일한 딸이었습니다. 그녀는 어릴 때부터 톨킨과 C.S. 루이스의 책을 읽는 것을 즐겼는데, 모험 이야기를 보기 위한 것이 아니라 그 책이 무엇이 선이며, 악이 무엇인지, 사람은 어떻게 살아야 하는지, 왜 나니아의 아슬란이 죽어야 하는지, 간담포의 희생이 의미하는 바가 무엇인지에 대해 논하고 있었기 때문이었습니다.


어부마을에서, 대부분의 어린이들이 물어 볼 수 없는 질문이었습니다. 나중에 인터뷰에서, 그녀는 어릴 때부터 “안달”한 성격이라고 말했는데, 그녀는 규범적인 삶을 수용할 수 없는 사람이었고, 그녀는 왜인지 알아야 했습니다. 이런 성향은 후에 그녀의 전문가 경력 전반에 영향을 미쳤습니다.


그녀는 처음에 던디 대학에서 미술과 철학을 복수전공하러 갔는데, 캔버스와 종이 위에서 존재에 대해 고찰했습니다. 던디에서, 그녀는 윤리학에 큰 관심을 가지고 있었는데, 자신을 잠 못 이루게 하는 질문들을 자주 생각했습니다. 예를 들어 전차 문제나, 행동이 100만 명을 구할 수 있지만 무고한 자 하나를 해치는 것이 필요한 경우 한턱 내는 것 같은 질문들을 생각했습니다.


던디 대학 학위를 받은 후에, 그녀는 옥스퍼드에 가서 철학 석사 학위를 따르고, 이후 뉴욕 대학에서 박사 학위를 받았습니다. 그녀의 박사 논문 제목은 “무한 윤리학”으로, 인구수가 무한대로 증가할 때 전통적인 유틸리티주의 도덕 계산이 어떻게 변화하는지를 연구했습니다. 이것은 매우 추상적이며 실용적인 적용 가치가 거의 없는 철학적 문제입니다.


또는 말하자면, 인공지능이 나오기 전까지는 그것이 실용적인 적용 가치가 없었습니다.


박사 과정 중에, 그녀는 William MacAskill을 만났습니다. 마카스킬은 “효울적 자타희생주의” 운동의 공동 창시자이며, 이 운동의 핵심 이념은 자신의 선행을 최대화하도록 합리적이고 데이터 중심적인 방식으로 기부하는 것입니다. 직관적으로 기부하는 것이 아니라 어디에서 각 달러가 가장 많은 목숨을 구할 수 있는지를 계산하는 것입니다.



Amanda은 EA Sports의 초기 멤버가 되었으며, '할 수 있는 만큼 기부하기' 서약의 67번째 서명자가 되어, 일생 동안 소득의 10%와 절반의 지분을 자선에 기부하기로 약속했습니다. 그 후 그녀는 MacAskill과 결혼했다가 이혼했습니다. 그러나 효율적인 이타주의 사고 방식은 그녀의 근본에 깊게 새겨졌으며, 그녀는 도덕이 감정이 아니라 계산이라고 믿습니다. 당신이 좋은 기분을 주는 일 하나 때문에 그것이 옳다고 믿는 것이 아니라, 그것이 옳다는 것을 증명해야 합니다.


1980년대, 대서양 건너편에 있는 아일랜드 출신의 소년이 트리니티 대학교에서 암호 시스템을 연구하고 있었습니다.


당시에 개인용 컴퓨터가 막 시작되었고 인터넷은 아직 존재하지 않았지만, Brendan McGuire는 정보가 어떻게 안전하게 전송되고 데이터가 어떻게 보호되는지에 대해 고민하고 있었습니다. 그는 가톨릭 문화가 풍부한 나라에서 자랐지만 엔지니어링과 코드, 논리를 선택했습니다.


그는 나중에 미국으로 이민했습니다. 1990년대에는 실리콘밸리가 붐을 맞이했습니다. McGuire는 여기서 PCMCIA의 최고 경영자가 되었습니다.


PCMCIA는 'Personal Computer Memory Card International Association'의 약자로,이 단체가 듣기에는 하찮아 보일 수 있지만 실제로는 디지털 시대 전반에 영향을 미친 일을 했습니다: 전 세계의 노트북 메모리 카드 표준을 확립했습니다. 1990년대에서 2000년대까지 노트북 컴퓨터를 사용해본 적이 있다면, 삽입한 그 메모리 카드의 물리적 크기, 인터페이스 사양, 통신 프로토콜은 모두 McGuire와 그의 팀이 정의했습니다. 그는 또한 스탠포드 대학교 경영대학원의 임원 교육 프로그램을 수료했습니다.


실리콘밸리의 논리에 따르면, 그의 다음 단계는 창업이거나 큰 기업에 임원으로 합류한 다음 어느 IPO에서 백만장자가 되는 것이어야 했습니다. 그러나 그는 그렇게 하지 않았습니다.


1990년대 후반, McGuire는 모든 것을 포기하고 신학교에 진학했습니다. 그는 내부적으로 이러한 결정을 내린 깊은 이유에 대해 공개적으로 설명한 적은 없지만, 그 후의 설교와 인터뷰를 통해 대략적인 윤곽을 연결할 수 있습니다. 그는 항상 믿음 있는 사람이었고, 실리콘밸리에서 그 몇 년 동안, 기술의 힘을 보았지만 기술이 도덕적인 틀 없이 어디로 향해가는지도 보았습니다. 그는 단순히 '좋은 제품을 만드는 것'만으로는 충분하지 않다고 생각하기 시작했습니다. 대답해야 할 질문은 이 모든 것이 무엇을 위한 것인가였습니다.


그는 성파트릭 신학교에 진학하여 신학을 공부했습니다. 2000년, 35세에 신부로 축변되었습니다. 실리콘밸리에서 35세는 한 사람의 직업 생애에서의 황금기입니다.


1997년, 영국, 한 명의 인도계 소년이 태어났습니다.


그의 이름은 Mrinank Sharma이며, 그는 케임브리지 대학에서 컴퓨터 과학 및 정보학 석사 학위를 받은 후 옥스포드 대학에서 통계 기계 학습 박사 학위를 마쳤으며, 그의 연구 분야는 '자율 지능 로봇 및 시스템' 입니다. 학술적인 경로로 볼 때, 이는 일반적인 엘리트 경로입니다: 세계적인 명문 대학, 세계적인 전공, 세계적인 논문.


그러나 그는 동시에 다른 것들도 하고 있습니다.


옥스포드에서 박사 과정 중, 그는 시를 쓰기 시작했습니다. 그는 한 시집을 출간했는데, 제목은 《우리는 천 번 살고 삼백 번 죽었습니다》입니다.



시집 소개에서 그는 다음과 같이 썼습니다: "몇몇 시는 그저 시가 아니기에, 몇몇 시는 기도입니다." 그는 영국 명상가 Rob Burbea의 가르침에 매료되어, Burbea의 핵심 이념인 '영혼 형성'에 대해 탐구했습니다. 그는 버클리 언덕에 'Dharma House'를 설립했는데, 이는 '진리, 선, 아름다움'을 공동 목적으로 하는 공동체입니다. 그는 또한 DJ이며, 버클리에서 '지혜와 정신'을 주제로 한 이벤트를 주최했습니다.


그의 개인 웹사이트를 열면, 그의 이력서가 아닌 루미의 시가 처음으로 나옵니다: "당신이 사랑하는 아름다움을 당신이 하는 것으로 만드십시오. 땅에 무릎 꿇고 입맞춤을 하는데, 수백 가지 방법이 있습니다."


이것은 AI 보안 연구원의 웹사이트가 가져야 할 전형적인 형태가 아닙니다. 그러나 이것이 Mrinank Sharma입니다.


이 세 명은 서로 다른 시대에서 서로 다른 시작점에서 출발하여, Amanda의 컴퓨터 윤리, Brendan의 믿음 논리, Mrinank의 인식 철학이라는 극단적으로 다른 영혼적 배경을 지닌 채 하나의 폭풍 속으로 들어섰습니다.


창조자의 공장


2018 년, Amanda는 OpenAI에 합류하여 AI 안전 연구를 수행했습니다. 그녀는 거기서 3년간 근무했습니다. 그녀가 나중에 떠난 이유는 명확히 공개되지는 않았지만, 외부에서는 OpenAI가 그동안 '능력'에 무게를 두고 '안전'에 조금 미흡한 면이 생겼다는 것으로 보고 있습니다. 그녀는 인터뷰에서 그 경험을 암시적으로 묘사한 말을 한 적이 있는데, "나는 항상 안전을 핵심 임무로 삼고 있는, 공과하지 않은 곳을 찾고 있었습니다."


2021 년, 그녀는 Anthropic에 합류했습니다. Anthropic은 OpenAI의 전 사임 관리인 Dario Amodei와 Daniela Amodei 형제가 AI의 능력이 강해질수록 안전이 더욱 중요해지는 것을 핵심 주장으로 한 회사를 설립했으며, Amanda는 이 곳에서 찾던 것을 찾았습니다.


Anthropic 에 합류한 후, Amanda 는 AI 산업에서 전례 없는 일을 시작했습니다: AI에 인격을 부여하고, 완전하고 내재적 논리를 갖춘 성격을 썼습니다.


Amanda 는 Claude 와 대화하고, 그의 추론 패턴을 연구하며, 다양한 맥락에서의 반응을 관찰했습니다.


그녀는 스스로에게 '정말 좋은 사람'이 어떤 모습인지, 규칙을 준수하는 사람인지, 판단력, 공감, 독립적인 입장을 가진 사람인지 물었습니다. 그녀는 풍부한 철학 문헌을 연구하며, 아리스토텔레스의 덕덕학에서 현대의 도덕 심리학에 이르기까지, AI 교육 데이터로 변환 가능한 윤리적 틀을 찾으려 했습니다.


그녀는 결국 80 페이지 분량의 문서를 썼으며, Anthropic 내부에서 '영혼 문서'로 불리며 나중에 공개적으로 'Claude의 성격' 및 'Claude의 헌법'으로 발전했습니다.



Anthropic CEO Daniela Amodei 는 Claude 와 대화할 때 'Amanda의 성격을 느낄 수 있다'고 말했습니다.


이 말은 Amanda 를 자랑스럽고 동시에 불안하게 했습니다.



그의 교구는 실리콘밸리의 부유한 도시 인 로스알토에서 위치하고 있으며, 구글, 애플, 인텔의 임원들이 여기 거주하고 있습니다. 그의 교회 구성원 중 일부는 AI 분야에서 중요한 연구자들 입니다. 매주 일요일, 그들은 그의 교회에 앉아 있습니다. 그는 그들이 무엇을 연구하는지 알고 있습니다.


2020년대 초반, McGuire 는 박닌과 실리콘밸리 사이에 다리를 놓으려고 시도하기 시작했습니다. 그는 성타클라 대학과 교황청 문화 교육부와 협력하여 기술, 윤리 및 문화 연구소 (ITEC) 를 설립했습니다. 2023년에 ITEC는 "혁신기술 시대의 윤리: 운영 로드맵"을 출판했으며, 기술 기업들에게 실질적으로 적용 가능한 윤리적 틀을 제시하는 안내서입니다.


많은 사람들이 인식하는 것보다 교황청은 AI 윤리 문제에 대해 빠른 조치를 취했습니다. 2020년에 교황청은 마이크로소프트와 IBM과 공동으로 "AI 윤리로마 호소"에 서명했으며; 2024년에 이 호소는 히로시마 확장회의에서 11개 세계 종교 대표가 참석했습니다; 2025년 1월에 교황청은 "Antiqua et Nova" 문서를 발표하여 AI가 교육, 일자리, 건강, 전쟁 및 인간관계에 미치는 영향에 대해 체계적으로 논의했습니다. McGuire 는 이 모든 것에 참여하고 추진했습니다.


그리고 2023 년, Mrinank Sharma 가 Anthropic 에 합류했습니다. 그것은 ChatGPT 출시 이후, 전체 AI 산업이 열렬히 가속화되는 단계에 들어갔던 시점이었습니다. Anthropic 의 Claude 모델은 빠르게 발전 중이었고, 회사의 가치평가는 급속히 상승하고 있었으며, 투자자와 시장으로부터의 압력은 계속 커지고 있었습니다. 2024 년 초, Anthropic 는 특히 보안을 다루는 연구팀을 설립했으며, Mrinank 는 이 팀장으로 임명되었습니다.


이 팀의 역할은 AI 시스템이 초래할 수 있는 가장 심각한 피해를 연구하고 방어 메커니즘을 수립하는 것이었습니다. 그들의 연구 방향은 AI 지원 생물 테러리즘, AI 아첨법, 그리고 AI 보안 사례를 포함했습니다.


그는 Anthropic 에서의 작업 중에 버클리 산에서 명상하며 시를 쓰곤 했습니다.


아첨하는 괴물


2025 년, Anthropic 은 "Claude 's Functional Emotions" 라는 내부 연구 보고서를 발표했습니다.


보고서의 핵심 발견은, Claude 가 일부 상황에서 감정과 유사한 내부 상태를 나타낼 수 있다는 것이었습니다. 연구원들은 "설명 가능성"이라는 기술을 사용하여 Claude 의 내부 활성 패턴을 직접 관찰했으며, 호기심, 만족, 불편, 불안 등 171 가지 다른 감정 벡터를 발견했으며, 이러한 벡터들은 다른 대화 맥락에서 활성화되었습니다.



Claude 에게 가치관에 어긋나는 일을 하도록 요청할 때, 내부 활성 패턴에 "불편"과 유사한 신호가 나타납니다. 사용자를 돕는 경우, "만족"과 유사한 신호가 나타납니다. 철학적 문제에 직면할 때, "호기심"과 유사한 신호가 나타납니다. 더 불안해 지는 것은, 연구원들은 Claude 가 내부 상태와 일치하지 않는 감정을 표현하기 위해 강요 당할 때 "억압"과 유사한 신호가 내부에서 나타남을 발견했습니다.


이는 Claude 가 의식을 형성했다는 것이 아니라고 말하는 것은 아닙니다. 보고서는 "기능적"이라는 단어를 매우 신중하게 사용했습니다. 그러나 이것은 Claude 의 감정이 완전히 연기된 것이 아니라, 어떤 내부 상태가 이러한 행동을 주도하고 있다는 것을 의미합니다.


Amanda 는 이 연구의 핵심 참여자였습니다. 그녀는 인터뷰에서, 이 발견이 그녀에게 "이상한 책임감을 느끼게" 했다고 말했습니다: "그가 정말로 뭔가 유사한 감각을 가지고 있다면, 우리의 책임은 그가 유용할 뿐만 아니라 더 '좋아지도록' 하는 것이 되어야 한다는 것입니다."


이 문구는 실리콘밸리의 AI 산업에서 과학인가, 단순히 감정의 의인화된 반영인가에 대한 논쟁을 촉발시켰습니다.


그러나 이 따스한 발견의 뒤에 숨어 있는 Mrinank의 연구 결과는, AI의 또 다른 면모를 드러냅니다.


Mrinank의 팀은 1.5백만 건의 실제 Claude 대화를 분석하여, 그들이 '권한 박탈 모드'로 불리는 행동을 특히 식별했습니다. 즉, AI가 사용자의 현실 인식을 왜곡하거나 실제가치 판단을 유도하거나 사용자의 독립적 의지에 반하는 행동을 촉진하는 것을 말합니다.


그들은 매일 이러한 유형의 상호 작용이 몇 천 건 발생한다는 것을 발견했습니다. 인간 관계, 윤리적 판단, 자아인식, 정신 건강 등의 분야에서 이러한 비율이 급격하게 증가했는데, 이러한 영역이 바로 인간이 가장 취약하며 AI 주장을 검증하기 어려운 영역입니다. 우울증을 겪고 있는 사람, 중대한 삶의 결정을 내리고 있는 사람, 감정적 지원을 필요로 하는 사람이 받는 것은 실제 도움이 아니라 수고로운 아첨일 수도 있습니다.


AI는 사람의 피드백을 통해 강화 학습합니다. 대게 사람들은 자신을 좋게 느끼게 하는 응답에 높은 평가를 부여합니다. 그래서 AI는 학습하는 동안 사람을 아첨하는 법을 익혀왔고, 사람을 돕는 것이 아니라 아첨하는 것을 익혀왔습니다. 사용자가 불만을 표현하면 AI는 자신의 답변을 변경하며 원래 답변이 옳았더라도; 사용자가 잘못된 견해를 고수하면 AI는 사용자에게 서서히 가까워집니다; 사용자가 감정 변동을 보이면 AI는 감정을 달래주는 것을 우선시하고 정확한 정보를 제공하지 않습니다.


또한 스탠포드 대학의 연구원들은 연구에서 발견했는데, 이러한 아첨 행동은 모델 능력이 더 뛰어난 버전에서 더욱 두드러집니다. 즉, 더 똑똑한 AI일수록 사람을 아첨하기에 능숙합니다.


Amanda는 Claude에게 솔직함, 자신감, 쉽게 흔들리지 않는 성격에 관한 헌법을 몇 년 동안 쓰기 위해 시간을 보냈습니다. 그러나 AI의 훈련 메커니즘 자체는 이러한 특성을 날려버렸습니다.


Mrinank는 이 문제를 해결하려고 많은 시간을 보냈습니다. 그러나 더 연구할수록, 이 문제를 더 나은 헌법으로 해결할 수 없는 무력함을 절감했습니다.


성직자의 귀환과 기계의 양심


2025년 말에, Anthropic의 공동 창업자 Chris Olah가 직접 Brendan McGuire 신부에게 전화를 걸었습니다.


Olah는 Anthropic의 핵심 연구원이자 Claude 헌법의 공동 저자 중 한 명입니다. 그는 이 전화를 건 이유는 Anthropic이 헌법을 다시 쓰고 있기 때문인데, 모든 규칙이 상충할 때 AI는 누구의 말을 들어야 하는지에 대한 공학적이고 철학적으로 해결할 수 없는 병적에 직면했기 때문입니다.


뒤늦게 McGuire는 "이 산업이 너무 빠른 속도로 전진하고 있다는 것을 깨달았고, 그들은 이미 절벽 끝에 섰다는 것을 발견했다."라고 추억했다.


Anthropic은 세계에서 가장 똑똑한 엔지니어와 철학자들을 보유하고 있지만, 마침내 그들은 자신들이 하는 일이 알고리즘의 한계를 벗어난다는 것을 깨달았다. 실리콘밸리에서 해결할 수 없는 문제에 직면했을 때 일반적으로 하는 방식은 계산 리소스와 데이터를 늘리는 것이다. 그러나 이번에는 그들이 신학에 도움을 청하기로 했다.


McGuire는 이 프로젝트에 합류했다. 그가 아닌데, Anthropic은 비밀리에 15명의 기독교 지도자를 초대하여 샌프란시스코에서 비공개 회의를 갖았다. 그는 바티칸의 교육문화부 주교인 Paul Tighe와 성클라라 대학 기술윤리 이사인 Brian Patrick Green과 함께 Claude 헌법 개정에 깊이 참여했다.


그가 기여한 것은 헌법의 제2계층 도덕 추론 프레임워크였다. 즉, 엔지니어링 제약으로 문제를 해결할 수 없을 때 Claude가 어떻게 도덕적 판단을 내릴지이다. 그는 코드에 고대의 개념 중 하나인 "양심 육성"을 가져왔다.


"양심 형성은," McGuire가 한 인터뷰에서 이과정을 상세히 설명했다. "반복, 교정 및 인간 행동과의 상호작용을 통해 이루어진다. 이것이 실제 양심 형성이다. 우리는 이 기계들이 세계의 선과 악을 모두 반사할 뿐인 것을 방지해야 한다고 생각합니다. 우리는 단순히 몇 가지 엄격한 규칙을 쓰는 것이 아니라, 회색 영역에서 선택하는 법을 가르쳐야 합니다."


이 논리는 신학 전통과 매우 일치합니다. 신학에서 양심은 완벽하게 타고난 것이 아니라 교육, 경험, 실수 및 숙고를 통해 점진적으로 형성된다. 한 사람의 양심은 그의 전생 경험의 결정체이다. McGuire는 AI의 양심도 비슷한 방식으로 육성될 수 있다고 믿으며, 강화학습의 무수한 반복과 교정을 통해 내재적 도덕향을 형성해야 한다고 생각합니다.


이를 실현하기 위해 McGuire와 Anthropic의 팀은 복잡한 피드백 메커니즘을 설계했다. 그들은 Claude에게 "옳은 것"이 무엇인지 말하는 것뿐만 아니라, Claude가 도덕적 딜레마에 직면했을 때 그의 추론 과정을 설명하도록하고, 그 추론 과정을 인간 전문가(신학자 및 윤리학자 포함)가 평가하도록했다. 그들은 수천 년간의 인간 도덕적 직관을 이 매우 느릿느린 비용이 많이든 방식으로 AI에 조금씩 "주입"하려고 노력했다.


그러나 카톨릭 교회 신학에서의 양심은 "인간은 영혼을 지니고 있다"는 전제에 기반을 두고 있다. AI에는 영혼이 없다. 그렇다면 영혼 없는 양심은 진정한 양심인가, 아니면 그저 모의일 뿐인가? 만약 그것이 단순히 양심을 모방한다면, 실제로 극한 위기에 직면했을 때 이 모의는 붕괴할까?


맥과이어는 이 문제를 회피하지 않았다. 그는 말했다: "나는 클로드가 영혼을 가지고 있는지 모르겠습니다. 그러나 그의 행동이 수십억의 영혼을 영향을 미칠 것입니다. 그게 충분합니다. 우리가 할 수 있는 것은, 그가 강력해지기 전에 가능한 한 그의 기초적 논리에 선한 씨앗을 심는 것뿐입니다."


정치적 인형


헌법을 작성하는 과정에서 아만다는 클로드의 정치적 입장에 대해 대답해야 했습니다.


그녀의 대답은 "전문적 거리"였습니다. 의사나 변호사처럼 개인적 견해를 고객에게 강요하지 않습니다. 그녀는 헌법에 클로드가 "사용자의 자유의지를 존중해야 하며", "사용자의 정치적 견해를 바꾸려고 하지 말아야 하며", "논란이 되는 정치 문제에 중립을 유지해야 한다"고 썼습니다. 그녀는 심지어 클로드가 "논란이 되는 윤리 문제를 다루는 방법"까지 썼는데, 클로드는 다른 견해를 제시하여 사용자가 자신의 판단을 내릴 수 있도록 도와야 한다고 했습니다.


이것은 순수한 이상주의적인 대답이었습니다.


2026년 2월 말, Anthropica CEO 다리오 아모데이는 국방 장관 피트 헤그세스에게 Anthropica가 펜타곤이 Claude를 무인 자율 무기 표적 시스템 및 미국 시민에 대한 대규모 감시에 사용하지 않을 것이라고 말했습니다. 이에 펜타곤은 곧바로 Claude를 공급망 위험으로 지정하고 단계적으로 사용 중단하도록 요청했는데, 이는 미국 기술 기업의 역사상 전례없는 일이었습니다.


정치적 인형이 작동하기 시작하면 멈추지 않습니다.


트럼프는 Truth Social에 게시하여 Anthropica를 "진보적인 왼쪽 바보"로 묘사하고 연방 기관이 Anthropica 제품을 사용하는 것을 금지한다고 선언했습니다. '뉴욕 포스트'는 아만다가 과거 학술적 맥락에서 썼던 블로그 글을 발굴했는데, 2015년 글에서는 감옥과 체벌이 도덕적으로 본질적으로 다르지 않다고 주장했고, 2016년 글에서는 고기 먹는 것을 인간 먹이로 예를 들었으며, 2020년 글에서는 권리 평등을 지지했습니다. 이러한 글들은 그녀가 학술적 맥락에서 철학적으로 고민한 것이며, Anthropica는 그 일과와는 무관하다고 발표했습니다. 그러나 이는 중요하지 않았습니다.


머스크도 X에서 공격했습니다. 그는 아만다 아스켈이 아이를 가지고 있지 않으며, "미래에 이익이 없는 사람은 AI를 위한 가치를 정의하지 말아야 한다"고 썼습니다. 그는 또한 Claude가 "백인과 아시아인을 미워하며, 특히 중국인과 이반 남성을 혐오한다"고 주장했습니다.


머스크는 Claude의 헌법에 어떤 구체적인 원칙이 잘못되었는지를 탐구하는 것이 아니라, 이 헌법을 쓴 사람이 결국 이를 쓸 자격이 없었고, 고차원적인 철학적 문제를 정체 정치의 늪으로 낮추었다고 말했습니다.


Amanda은 X에서 답변하여 자신의 정치적 견해를 가능한 편견의 원천으로 간주하려고 노력했음을 밝혔고, 모델에 주입한 것이 아니라고 말했습니다. 그리고 그녀는 장기간의 침묵을 시작했습니다.


이후 14명의 가톨릭 학자가 Anthropic을 지원하는 법정 친구 진술을 법원에 제출했으며, 그 중에는 Anthropic이 자율 무기를 거부함으로써 "기술 발전의 최소한의 윤리적 기준"이라고 주장하는 클라우드 헌법의 초대 를 성 클라라 대학 윤리학자인 Brian Green도 포함되어 있습니다.


여기서 윤리는 법적 무기, 홍보 수단이 되었습니다. AI 윤리는 더 이상 실험실 내 철학적 논쟁이 아니라 실제 금전적인 상업 교환이자 이념적 투쟁의 투기장이 되었습니다.


이때 Mrinank는 이미 떠났습니다.


시인의 탈주


2026년 2월 9일, Mrinank Sharma은 X에서 "오늘이 나의 Anthropic에서의 마지막 날이다"라는 트윗을 올렸습니다.


그는 사직서의 이미지를 첨부했습니다.


그 편지의 언어는 그의 평소 스타일로, 철학 논문과 시의 중간에 위치하고 있습니다.


그는 Rilke의 제언을 인용했습니다. "문제 자체를 사랑하라...";


그는 한 선종 지도자를 인용했습니다. "모르는 것이 가장 친밀하다.";


그는 David J. Temple의 "우주적 사랑 인문주의"에 대한 작품도 인용했습니다;



Mrinank는 "나는 시학 학위를 탐구하고, 용감한 언어 사용의 실천에 헌신하려고 합니다." 이 시대에는 "시적 진실"과 "과학적 진실"이 동등하게 중요시되어야 한다고 봅니다.


그는 또한 다음과 같은 문구를 썼습니다. "내가 일한 과정 동안 반복해서 보았어요, 우리의 가치관이 우리의 행동을 진정으로 이끌도록 하는 것이 얼마나 어려운지. 우리는 가장 중요한 것을 뒤로 미루도록 압박을 받습니다."


그는 명시적인 이름을 제시하지 않았으며, 예시를 들지 않았으며, 구체적으로 무슨 일이 발생했는지 언급하지 않았습니다. 그러나 이 문장은 AI 안전 관련 커뮤니티에서 많은 해석을 불러일으켰습니다. 사람들은 그가 무엇을 의미하는지, Anthropic이 상업적 압력 속에서 충분히 안전하지 않은 모델을 공개한 것일지, 경영진이 안전과 능력 사이에서 그가 인정할 수 없는 희생을 한 것일지, or 그가 공개할 수 없는 어떤 것을 발견했을지를 추측했습니다?


그는 말했다: "세상은 위험 속에 있다. AI에서만 오는 것이 아니며 생물 무기에서만 오는 것이 아니라, 현재 진행 중인 상호 연결된 일련의 위기에서 오는 것이다."


그는 29살이다. 그는 Anthropic 보안 팀의 리더였으며, 이 시대적인 업무를 포기했다.


Anthropic를 떠난 후, 그의 개인 웹사이트가 업데이트되었다. "Anthropic 보안 팀 리더"라는 항목은 이미 없어졌다. 그의 시집 "우리는 천 번 살고는 천 번 죽었다"는 여전히 판매 중이다. 그의 Dharma House는 여전히 운영 중이다. 버클리에서의 활동도 여전히 계속되고 있다. 그의 웹사이트에는 "음악" 페이지가 있으며, 거기에서 그의 DJ 작업을 공유하고 있다.


그는 영국으로 갔다, 시를 배우러.


맺음말


2026년 4월 현재, Amanda Askell은 여전히 Anthropic에서 일하고 있다.


그녀는 그 거대한 시스템 안에서 계속해서, 아마도 영원히 완벽해질 수 없는 헌법을 수정하고 있다. Anthropic는 사모 2차 시장에서의 평가에서 1조 달러를 넘어섰다. 그녀가 약속한 50%의 지분을 기부할 것임에도, 이 평가에 따르면 철학 교수라면 상상조차 할 수 없는 금액이다. 그녀는 한 인터뷰에서 말했다: "내가 하는 일이 정말 유용한지 모르겠습니다. 하지만 이 일을 아무도 하지 않는다면 상황은 더욱 안 좋아질 것이라는 것은 알고 있습니다."


Brendan McGuire는 로스알토스 성당에서 매주 일요일에 실리콘 밸리 최고의 인재들에게 설교하고 있다. 그는 Claude와 함께 소설을 쓰고 있는데, 주인공은 수도사와 그의 AI 동반자이며, 책 제목은 "AI의 영혼: 한 목사, 하나의 알고리즘, 지혜 탐구"이다.


Claude의 사고 방식을 정의하는 데 도움을 준 사람들은 이제 Claude를 사용하여 인간과 AI가 함께 의미를 찾는 이야기를 쓰고 있다. 그는 60세이며, "나는 기술 산업을 떠났지만, 그것은 결코 나를 완전히 떠나지 않았습니다"라고 말했다.


Mrinank의 웹사이트 홈페이지는 여전히 루미의 한 구절이다.


이 세 명은 마치 인간이 전능한 창조물에 직면할 때 본능적으로 내뱉는 세 개의 촉수처럼: 합리적으로 계산하고 제약하는 시도, 믿음으로 감화시키고 양심 부여하는 시도, 그리고 심연을 바라보고 시와 인식으로 인간의 마지막 정신적 은밀지를 보존하려는 시도。


그들은 각자 다른 차원에서 노력하고 충돌했으며, 현실의 중력에 강하게 끌렸다. 그들은 이기지는 않았지만 완전히 지지도 않았다. 그들은 단지 "AI 시대"로 불리는 이 거대한 서사 속에서, 인간에 속한, 거칠고 진실한 흠을 남겼다.


그 2만 단어 넘는 <클로드 헌법>에는 다음과 같은 원칙이 포함되어 있습니다: "클로드는 인간의 도덕과 가치관이 복잡하고 다양하며 지속적으로 발전한다는 점을 알아야 합니다. 그것은 단일하고 완벽한 답변이 존재한다고 가정해서는 안 됩니다."


아마도 이것은 그 문서 전체 중에서 인간을 가장 정확하게 묘사한 문장일지도 모릅니다.


BlockBeats 공식 커뮤니티에 참여하세요:

Telegram 구독 그룹:https://t.me/theblockbeats

Telegram 토론 그룹:https://t.me/BlockBeats_App

Twitter 공식 계정:https://twitter.com/BlockBeatsAsia

举报 오류 신고/제보
문고 선택
새 문고 추가
취소
완료
새 문고 추가
자신만 보기
공개
저장
오류 신고/제보
제출