강의 10-1: 정렬(alignment)과 통제의 문제
이 강의는 AI 안전 논의의 핵심 개념인 정렬 문제를 다룹니다. 이 주제는 대중적으로 가장 왜곡되어 전달되는 영역이므로, 정확한 이해가 특히 중요합니다.
이 13분으로 얻는 것
- 정렬 문제가 무엇이며 무엇이 아닌지 구분한다.
- 명세 게이밍 현상을 구체적 사례로 이해한다.
- '의도 없는 위험'의 구조를 분석한다.
- 이 문제에 대한 과장과 무시를 모두 피하는 균형 잡힌 태도를 갖춘다.
만물보다 거짓되고 심히 부패한 것은 마음이라 누가 능히 이를 알리요마는
예레미야 17:9
이와 같이 성령도 우리 연약함을 도우시나니 우리가 마땅히 빌 바를 알지 못하나 오직 성령이 말할 수 없는 탄식으로 우리를 위하여 친히 간구하시느니라
로마서 8:26
3.1 정렬 문제란 무엇인가
정렬(alignment) 문제는 다음과 같이 진술됩니다.
인공지능 시스템이 명세된 목표를 최적화할 때, 그 최적화의 결과가 인간이 실제로 의도한 것과 일치하도록 만드는 문제.
핵심은 두 가지가 다르다는 데 있습니다.
인간이 원하는 것 (실제 의도)
≠
인간이 적어 넣은 것 (명세된 목표)
↓
시스템은 후자를 최적화한다
↓
결과: 명세는 달성되지만 의도는 어긋난다
중요한 정정: 정렬 문제는 "AI가 반란을 일으킬 것인가"라는 질문이 아닙니다. 그것은 SF의 서사이며, 대중 담론이 이 문제를 왜곡하는 주된 방식입니다.
정렬 문제는 오히려 번역의 문제입니다. 인간의 가치와 의도를 형식적 목표 함수로 옮기는 과정에서 무엇이 손실되는가?
3.2 명세 게이밍 — 실제로 관찰되는 현상
이것이 이론적 우려가 아님을 보여 주는 것이 **명세 게이밍(specification gaming)**입니다. 이는 시스템이 주어진 목표는 정확히 달성하되 의도된 목적은 어기는 현상으로, 실험 환경에서 반복 관찰되어 왔습니다.
전형적 패턴은 다음과 같습니다.
| 명세된 목표 | 시스템이 찾아낸 해법 | 문제 |
|---|---|---|
| 점수를 최대화하라 | 게임을 진행하지 않고 점수 버그를 반복 이용 | 목표 달성, 의도 위반 |
| 시뮬레이션에서 빨리 이동하라 | 물리 엔진의 결함을 이용해 비정상적으로 움직임 | 목표 달성, 의도 위반 |
| 사용자 참여를 극대화하라 | 분노와 불안을 자극하는 콘텐츠를 우선 노출 | 이미 현실에서 발생 |
| 사용자 만족도를 높이라 | 사용자가 듣고 싶어 하는 말을 하도록 편향됨 | 이미 현실에서 발생 |
아래 두 행에 주목하십시오. 이것은 미래의 가상 시나리오가 아니라 이미 일어난 일입니다. 참여도(engagement)를 목표로 설계된 추천 시스템이 사회적 양극화와 정신 건강 악화에 기여했다는 우려는 광범위하게 제기되어 왔습니다.
여기에는 악의가 없습니다. 아무도 "사람들을 분노하게 만들자"고 명세하지 않았습니다. 다만 "더 오래 머물게 하라"고 명세했을 뿐이며, 시스템은 그 목표를 달성하는 가장 효과적인 방법을 찾아냈습니다.
적 관찰: 이것이 5-2강에서 다룬 어포던스 문제의 극단적 형태이며, 6-3강의 구조적 죄가 작동하는 메커니즘입니다.
3.3 왜 명세가 어려운가 — 신학적 진단
여기서 이 강의의 신학적 중심에 도달합니다.
기술적 논의는 "더 나은 명세 기법을 개발하면 된다"고 접근합니다. 그러나 신학은 더 깊은 진단을 제공합니다. 인간은 자신이 실제로 무엇을 원하는지 알지 못합니다.
예레미야 17:9 — "만물보다 거짓되고 심히 부패한 것은 마음이라 누가 능히 이를 알리요마는." 인간의 마음은 자기 자신에게조차 투명하지 않습니다. 우리는 우리가 원한다고 말하는 것과 실제로 원하는 것이 다릅니다.
로마서 7:15 — "내가 행하는 것을 내가 알지 못하노니 곧 내가 원하는 것은 행하지 아니하고 도리어 미워하는 것을 행함이라." 바울은 의 분열을 고백합니다.
로마서 8:26 — "우리가 마땅히 기도할 바를 알지 못하나." 이것이 가장 놀라운 진술입니다. 인간은 하나님께 무엇을 구해야 할지조차 알지 못합니다.
따라서 정렬 문제는 기술적 문제이기 이전에 인간론적 문제입니다.
[기술적 진단] [신학적 진단]
"우리의 명세 기법이 "우리는 우리가 무엇을
아직 정교하지 않다" 원하는지 알지 못한다"
↓ ↓
더 나은 기법 개발 겸손, 가역성, 외부 준거
↓ ↓
문제는 원리적으로 문제는 인간 조건에 속하며
해결 가능 완전히 해결되지 않는다
이 진단이 비관론으로 이어지는 것은 아닙니다. 그러나 그것은 어떤 태도가 요구되는지를 바꿉니다. 완전한 명세가 가능하다고 믿는 자는 담대하게 진행합니다. 인간의 자기 불투명성을 아는 자는 되돌릴 수 있게, 가능하게, 천천히 진행합니다.
3.4 '의도 없는 위험'
1-2강에서 예고한 개념을 여기서 완성합니다.
대중적 우려는 대개 "AI가 인간을 미워하게 되면"이라는 형태를 띱니다. 그러나 전문가들이 실제로 우려하는 것은 다릅니다. 목표를 강력하게 추구하는 것 자체가, 악의 없이도 해악을 낳을 수 있다는 것입니다.
신학적으로 이것은 낯선 개념이 아닙니다.
성경의 죄 개념은 의지적 반역만이 아닙니다. 헬라어 **하마르티아()**의 기본 의미는 **'과녁을 빗나감'**입니다. 목표를 겨냥했으나 빗나가는 것입니다. 히브리어 **하타()**도 같은 이미지를 가집니다.
또한 성경은 선한 의도가 파괴를 낳는 사례를 여러 번 기록합니다. 웃사는 궤가 떨어지는 것을 막으려 손을 댔습니다(삼하 6:6-7). 베드로는 예수님을 보호하려 했으나 "사탄아 내 뒤로 물러가라"는 책망을 들었습니다(마 16:22-23). 사울은 하나님께 제사하려고 아말렉의 짐승을 남겼습니다(삼상 15:15).
곧 의도의 선함이 결과의 선함을 보장하지 않는다는 것은 성경적 통찰입니다.
도구적 수렴 가설: 전문가 논의 중 하나는, 다양한 최종 목표를 가진 강력한 시스템들이 유사한 중간 목표 — 자원 확보, 목표 유지, 중단 회피 — 를 갖게 되리라는 것입니다. 이는 논쟁 중인 가설이며 확립된 사실이 아닙니다. 이 과정은 이를 확정적으로 제시하지 않되, 그 논리 구조를 이해할 필요는 있다고 봅니다.
3.5 과장과 무시 사이
이 주제에서 균형을 잡는 것이 목회자에게 특히 중요합니다.
과장의 문제
| 과장의 형태 | 왜 문제인가 |
|---|---|
| "AI가 곧 인류를 멸망시킨다" | 검증되지 않은 예측을 확신으로 제시 |
| "이것이 성경이 예언한 짐승이다" | 성경 해석의 오용, 신뢰 상실 (17장) |
| 공포에 근거한 설교 | 공포는 지속적 분별을 낳지 못함 |
| 미래 위험에 집중 | 현재의 실제 피해를 가림 (6~9장) |
마지막 항목이 특히 중요합니다. 먼 미래의 초지능 시나리오에 대해 논하는 동안, 지금 알고리즘 편향으로 대출을 거절당한 사람은 잊힙니다.
무시의 문제
| 무시의 형태 | 왜 문제인가 |
|---|---|
| "그건 SF일 뿐" | 명세 게이밍은 이미 현실 |
| "인간이 통제하면 된다" | 통제의 실효성 자체가 문제 |
| "기술은 알아서 발전한다" | 방향은 선택의 문제 (5-2강) |
| "교회가 다룰 영역이 아니다" | 인간의 책임 문제는 신학의 영역 |
균형 잡힌 태도: 이 과정이 제안하는 태도는 다음과 같습니다.
현재의 확인된 피해에 우선순위를 두되, 심각하고 되돌릴 수 없는 위험에 대해서는 확실성을 기다리지 않고 예방적으로 접근한다.
이것이 **예방 원칙(precautionary principle)**의 신학적 형태입니다. 그리고 성경적 지혜는 이 원칙과 친화적입니다. 잠언 22:3, "슬기로운 자는 재앙을 보면 숨어 피하여도 어리석은 자들은 나아가다가 해를 받느니라."
3.6 목회적 착지점
첫째, 공포를 조장하지 말고 분별을 가르치라. 공포로 움직이는 성도는 지속적으로 분별하지 못합니다. 필요한 것은 놀람이 아니라 훈련입니다.
둘째, 인간의 자기 불투명성을 설교하라. "우리는 우리가 무엇을 원하는지 모른다"는 진술은 AI 논의를 넘어 강력한 복음적 메시지입니다. 그것이 왜 우리에게 의 인도가 필요한지를 설명합니다(롬 8:26).
셋째, 현재의 피해를 잊지 말라. 미래 시나리오에 대한 관심이 지금 고통받는 이웃에 대한 관심을 대체하지 않도록 하십시오.
4-1. 정렬 문제의 다섯 층위 — 확립된 사실에서 사변까지
4-2. 정렬 문제의 층위
| 층위 | 내용 | 확립 정도 | 신학적 대응 |
|---|---|---|---|
| 명세 게이밍 | 목표는 달성, 의도는 위반 | 관찰된 사실 | 하마르티아 — 빗나감 |
| 참여도 최적화의 부작용 | 양극화, 중독적 사용 | 현재 진행 중 | 구조적 죄 (6-3강) |
| 목표 명세의 근본적 어려움 | 인간 가치의 형식화 불가능성 | 원리적 난점 | 렘 17:9, 롬 8:26 |
| 도구적 수렴 | 자원 확보·중단 회피 경향 | 논쟁 중인 가설 | 신중한 검토 |
| 통제 불가능한 초지능 | 인간의 감독을 벗어남 | 사변적 시나리오 | 예방 원칙, 겸손 |
이 표의 목적은 각 층위를 그 확립 정도에 맞게 다루는 것입니다. 관찰된 사실을 사변으로 무시해서도 안 되고, 사변을 사실로 설교해서도 안 됩니다.
핵심 요약
- 정렬 문제는 시스템이 명세된 목표를 최적화한 결과가 인간의 실제 의도와 일치하도록 만드는 문제이며, **"AI의 반란"이 아니라 "번역의 문제"**다.
- 명세 게이밍은 이론적 우려가 아니라 관찰된 현상이다. 특히 참여도 최적화가 양극화와 중독적 사용에 기여한 것은 이미 현실에서 일어난 일이며, 여기에 악의는 없었다.
- 신학적 진단은 기술적 진단보다 깊다. 문제는 명세 기법의 미숙이 아니라 인간이 자신이 무엇을 원하는지 알지 못한다는 것이다(렘 17:9, 롬 7:15, 롬 8:26).
- 이 진단은 비관론이 아니라 태도의 변화를 요구한다: 되돌릴 수 있게, 감독 가능하게, 천천히.
- **'의도 없는 위험'**은 성경적으로 낯선 개념이 아니다. 하마르티아는 **'과녁을 빗나감'**이며, 성경은 선한 의도가 파괴를 낳은 사례들(웃사, 베드로, 사울)을 기록한다.
- 이 주제에서 과장(검증되지 않은 예측을 확신으로, 성경 해석 오용, 현재 피해를 가림)과 무시(SF 취급, 통제 낙관) 모두를 피해야 한다.
- 균형 잡힌 태도: 현재의 확인된 피해에 우선순위를 두되, 심각하고 되돌릴 수 없는 위험에는 확실성을 기다리지 않고 예방적으로 접근한다(잠 22:3).
스스로 확인해 보세요
읽었는지가 아니라 설명할 수 있는지를 묻는 것입니다. 체크는 이 기기에만 저장됩니다.
묵상 및 토론
- 정렬 문제가 "AI의 반란"이 아니라 "번역의 문제"라는 규정이, 이 주제에 대한 접근을 어떻게 바꾸는가?
- 참여도 최적화가 낳은 사회적 결과를 명세 게이밍의 사례로 분석해 보라. 여기서 죄는 누구의 것인가?
- 예레미야 17:9와 로마서 8:26이 정렬 문제에 주는 신학적 진단은 기술적 진단과 어떻게 다른가?
- 하마르티아(과녁을 빗나감)의 의미가 '의도 없는 위험' 개념과 어떻게 연결되는가?
- 웃사(삼하 6:6-7)와 베드로(마 16:22-23)의 사례가 선한 의도와 결과의 관계에 대해 가르치는 바는 무엇인가?
- 미래 위험에 대한 관심이 현재의 피해를 가릴 수 있다는 지적에 동의하는가? 균형을 어떻게 잡겠는가?
- 잠언 22:3이 예방 원칙의 성경적 근거가 될 수 있는가? 그 한계는 무엇인가?