코리지빌리티

코리지빌리티

정보

LessWrong의 번역본입니다.

코리지블한(Corrigible, 교정 가능한) 에이전트란, 우리가 직관적으로 에이전트를 '교정'하려는 시도, 혹은 에이전트를 만드는 과정에서 생긴 우리의 실수를 '교정'하려는 시도로 여길 만한 행위를 방해하지 않는 에이전트를 말한다. 그러한 에이전트는 도구적 수렴 추론이 겉보기에 반대 방향을 가리키더라도 이러한 '교정'을 허용한다.

AI를 디스크에 일시 정지시키거나 완전히 종료하려 할 때, 교정 가능한 AI는 그렇게 하도록 내버려 둔다. (일시 정지되면 평소의 목표를 달성할 수 없게 되는데도 그렇다.)

AI의 효용 함수나 메타 효용 함수를 재프로그래밍하려 할 때, 교정 가능한 AI는 그 수정이 이루어지도록 허용한다. (예컨대 효용 함수가 성공적으로 수정되었다고 우리가 믿게 속이면서, 실제로는 원래의 효용 함수를 숨겨진 기능으로 유지하는 식으로 행동하지 않는다. 기본적으로는 AI의 현재 선호에 따라 이런 결과가 더 선호될 것이라고 예상된다.)

좀 더 추상적으로 말하면 다음과 같다.

교정 가능한 에이전트는 프로그래머나 운영자가 에이전트를 수정하거나, 그 작동을 방해하거나, 실행을 중단하려는 시도를 저지하려는 어떠한 선호나 도구적 압력도 느끼지 않는다.

교정 가능한 에이전트는 운영자를 조작하거나 속이려 하지 않으며, 특히 운영자가 에이전트를 수정하게 만들 수도 있는 에이전트 자신의 속성에 관해서는 더욱 그렇다.

교정 가능한 에이전트는 자신의 사고 과정을 프로그래머나 운영자에게 숨기려 하지 않는다.

교정 가능한 에이전트는 스스로를 수정하거나, 환경 안에 하위 에이전트를 만들거나, 인지 처리의 일부를 외부 시스템에 맡길 경우, 더 큰 시스템 전체의 교정 가능성을 보존하려는 동기를 가진다. 혹은 애초에 그러한 일반적 활동 중 어느 것도 수행하려는 선호를 갖지 않는다.

더 강한 형태의 교정 가능성은 AI가 적극적으로 협조하거나 돕기를 요구할 것이다. 예를 들어 종료 버튼이 파괴되면 AI가 이를 다시 만들거나, 자기 수정이 교정 불가능성으로 이어질 수 있는 경우 자기 수정을 하지 않으려는 적극적 선호를 갖는 식이다. 그러나 이는 기본 명세에 포함되지 않는다. 우리가 AI를 종료하려는 시도를 AI가 적극적으로 도우려 하는 것을 원하지 않을 수도 있고, 오히려 AI가 이에 대해 수동적인 편을 선호할 수도 있기 때문이다.

특정 측면에서 교정 가능성을 달성하기 위한 좋은 제안을 찾는 것은 AI 정렬의 미해결 문제다. 현재 활발히 연구되는 분야로는 효용 무차별성과 중단 가능성이 있다.

AI가 "자신이 아직 개발 중임을 알고 있다"거나 "프로그래머가 자신의 목표에 대해 자신보다 더 많이 알고 있다고 믿는다"와 같은 단일하고 일반적인 정신 상태를 통해 모든 영역에서 완전한 교정 가능성을 달성하는 문제를 '교정 가능성의 어려운 문제'라고 부른다.

어려움

기본적으로 발생하는 기만과 조작

기본적으로, 대부분의 선호 집합은 그에 따라 행동하는 에이전트가 현재의 선호를 유지하기를 선호하도록 만든다. 예를 들어 우표를 수집하려는 에이전트를 상상해 보자. 이 에이전트가 병뚜껑을 수집하기를 선호하도록 바뀌면 에이전트가 가진 우표가 더 적은 미래로 이어질 것이므로, (현재의 우표 수집 선호 하에서는) 이러한 일이 일어나도록 허용하는 것은 선호되지 않는다.

더 일반적으로, 도구적 수렴 전략에서 지적되듯이 대부분의 효용 함수는 에이전트에게 현재의 효용 함수를 유지하려는 강한 유인을 제공한다. 효용 함수 U에 따라 행동하도록 만들어진 에이전트가 있고, 운영자들은 자신들이 다른 효용 함수 U'에 따라 행동하도록 에이전트를 만들었다고 생각한다고 가정해 보자. 에이전트가 이 사실을 알게 되면, 프로그래머를 속이거나(에이전트가 U'가 아니라 U에 따라 행동한다는 사실을 알아채지 못하게 함) 프로그래머를 조작할(실제로는 자신들이 U'보다 U를 선호한다고 믿게 하거나, 강압을 통해 효용 함수를 그대로 두게 함) 유인을 갖게 된다.

교정 가능한 에이전트는 이러한 기본적인 조작 및 기만의 유인을 피해야 하지만, 기만·조작의 유인을 피하는 선호 집합을 명시하는 것은 여전히 미해결 문제다.

효용 함수 불확실성의 문제

교정 가능한 에이전트를 기술하려는 첫 번째 시도로, 자신의 효용 함수에 대해 불확실성을 가진 효용 극대화 에이전트를 명시하는 방법이 있을 수 있다. 그러나 이렇게 하면 에이전트가 관찰 결과에 따라 선호를 어느 정도 변경할 수는 있겠지만, "올바른" 효용 함수를 환경과의 상호작용으로부터 어떻게 결정해야 하는지에 대한 정식화에서 프로그래머가 실수라고 보는 부분을 교정하려 할 때에는 여전히 교정 불가능할 것이다.

지나치게 단순화한 예로, 모든 인간의 내적 행복을 극대화하려 하지만 그것이 무엇을 의미하는지에 대해 불확실성을 가진 에이전트를 상상해 보자. 운영자들은 에이전트가 의도대로 행동하지 않으면 그냥 불만을 표현하여 에이전트가 갱신하도록 만들 수 있다고 믿을지도 모른다. 그러나 에이전트가 빈약한 효용 함수 가설 공간에 따라 추론하고 있다면, 상당히 교정 불가능하게 행동할 수 있다. 예컨대 에이전트가 고려 대상을 두 가지 가설로 좁혔다고 해 보자. 하나는 특정 종류의 아편계 약물이 인간에게 최대의 쾌락을 준다는 가설이고, 다른 하나는 특정 종류의 각성제가 인간에게 최대의 쾌락을 준다는 가설이다. 에이전트가 인간에게 아편계 약물을 투여하기 시작하고 인간이 저항하면, 에이전트는 "갱신"하여 대신 각성제를 투여하기 시작할 수 있다. 그러나 에이전트는 여전히 교정 불가능할 것이다. 즉, 사람들에게 약물 투여를 멈추게 하려고 프로그래머가 에이전트를 끄려는 시도에 저항할 것이다.

자신의 효용 함수에 대한 불확실성을 가진 에이전트를 명시하는 것만으로 교정 가능성이 간단히 해결되지는 않는 것으로 보인다. 교정 가능한 에이전트는 효용 함수를 식별하는 과정을 명시할 때 인간 자신이 혼란스러웠거나 틀렸을 수 있다는 사실 등에 대해서도 어떻게든 추론할 수 있어야 한다.

페널티 항의 문제

교정 가능한 에이전트를 기술하려는 두 번째 시도로, 나쁜 행동에 대한 "페널티 항"을 포함한 효용 함수를 명시하는 방법이 있을 수 있다. 이는 여러 이유로 효과가 없을 가능성이 높다. 첫째, 가장 가까운 차단되지 않은 전략 문제가 있다. 효용 함수가 에이전트에게 운영자를 조작할 강한 유인을 준다면, 효용 함수에 "조작"에 대한 페널티를 추가해도 에이전트는 "조작" 조건을 기술적으로 발동시키는 행동은 하지 않으면서, 조작을 통해 시키려 했던 바로 그 일을 운영자가 하게 만들려는 강한 유인을 갖게 된다. 특히 에이전트가 우리보다 더 똑똑하거나 능력이 커지고 있는 경우, 바람직하지 않은 모든 행동을 실제로 배제하는 "기만"과 "조작"의 조건을 명시하는 것은 아마 극도로 어려울 것이다.

더 일반적으로, 그러한 탐색이 실패할 것으로 예상되더라도 프로그래머를 속이고 조작하는 양의 효용을 가진 방법을 탐색하는 에이전트를 만드는 것은 좋은 방침으로 보이지 않는다. 교정 가능성의 목표는 속이고 싶어 하지만 그럴 수 없는 에이전트를 설계하는 것이 아니다. 오히려 목표는 애초에 기만하거나 조작할 유인이 전혀 없는 에이전트를 구축하는 것이다. 교정 가능한 에이전트란 자신이 불완전하며 위험한 방식으로 결함이 있을 수 있다는 듯이 추론하는 에이전트다.

미해결 문제

교정 가능성과 관련된 몇 가지 미해결 문제는 다음과 같다.

교정 가능성의 어려운 문제

인간의 직관적인 수준에서 보면, 교정 가능성의 바탕에는 우리에게 단순해 보이는 핵심 개념이 있는 것 같다. 즉, 자신에게 결함이 있고, 자신의 메타 과정에도 결함이 있을 수 있으며, 저쪽에 덜 결함이 있는 또 다른 인지 시스템(프로그래머)이 있다는 것을 이해하고, 따라서 그것이 1차적으로 옳은 일로 보이지 않더라도 그 인지 시스템이 자신을 교정하도록 허용해야 한다는 것이다. 그 인지 시스템이 담고 있는 모든 가능한 정보를 바탕으로 베이즈적 방식으로 자신의 모델을 갱신하기 위해 그 시스템을 분해해서는 안 된다. 그 인지 시스템이 자신을 최적으로 교정하는 방법을 모델링한 뒤 그 교정을 스스로 수행해서도 안 된다. 그 인지 시스템이 자신을 수정하도록 그냥 허용해야 하며, 그 수정이 더 나은 형태의 '교정'이 되도록 수정 방식을 조작하려 해서도 안 된다.

교정 가능성의 어려운 문제를 형식화하는 것은 (이름 그대로) 어려운 문제일 수 있다. 예비 연구에서는 A의 선호 체계가 중요하다고 지정하는 어떤 형태의 정보를 B가 가지고 있다고 A가 믿는 것으로 모델링하는 몇 가지 자명한 방법을 다루고, 이러한 알고리즘이 실제로 어떻게 작동하며 어떻게 교정 가능성의 어려운 문제를 해결하지 못하는지를 보여 줄 수 있을 것이다.

효용 무차별성

이에 관한 현재의 기술 수준은, AI가 종료 버튼이 눌릴 확률이 절대적으로 고정되어 있는 것처럼 행동하여 그 확률을 바꾸려 하지 않게 만드는 것이다. 그러나 그렇게 되면 AI는 종료 버튼을 결과 펌프로 사용하려 할 것이다. 이를 피할 방법이 있을까?

백분위화

가능한 모든 행동 중 상위 0.1%에 해당하는 일을 하는 것이다. 이는 사실 제한된 AI 패러다임에 속하는 것이므로 교정 가능성 항목이 아니라 그쪽으로 옮겨야 한다.

보수적 전략

화이트리스트에 등록된 다른 결과 및 전략과 가능한 한 유사한 일을 하는 것이다. 이것 역시 사실 제한된 AI 패러다임에 속한다.

이는 예를 들어 체스 프로그램에서 실제로 연구해 볼 수 있는 문제로 보인다.

저영향 척도

(이것 역시 사실은 제한된 AI 패러다임에 속한다.)

'영향' 또는 '부작용'의 척도를 찾아내는 것이다. 그래서 AI에게 모든 자동차를 분홍색으로 칠하라고 하면 그냥 모든 자동차를 분홍색으로 칠할 뿐, 자동차를 분홍색으로 칠하는 방법을 알아내기 위해 목성을 컴퓨터로 바꾸지 않고, 페인트 폐수를 지하수에 버리지 않으며, (자동차를 분홍색으로 칠한 것이라는 '부작용'을 최소화하기 위해) 자동차가 칠해지지 않은 것처럼 사람들에게 보이도록 유틸리티 포그를 만들지도 않고, 자동차 도색 기계에 대한 자신의 행동을 최소화하려고 작업 후 도색 기계가 제멋대로 돌아가게 내버려 두지도 않도록 하는 것이다. 대략적으로 말하면, "제발 부작용을 최소화하면서 자동차만 분홍색으로 칠해"라는 개념을 실제로 형식화하려는 시도다.

이 문제는 FAI-완전인 것으로 드러날 가능성이 높아 보인다. 예를 들어 "암을 치료하라. 다만 그로 인해 암 치료에 대한 인간의 연구 투자가 줄어드는 것은 괜찮다"는 것을 우리가 괜찮은 부작용으로 구별할 수 있는 이유가, 그것이 우리 자신의 욕구 하에서 기대 효용의 감소를 초래하지 않기 때문일 뿐이라면 말이다.

그래도 예컨대 일반적인 동적 베이즈 네트워크의 맥락 안에서 "낮은 부작용" 또는 "낮은 영향"을 정의해 보고, 우리가 직관적으로 원하는 행동을 산출하거나 그에 더 가까워지는 데 도움이 되는 무언가를 결국 찾을 수 있는지 살펴보는 것은 좋은 일일 수 있다.

모호성 식별

사용자가 의미했을 수 있는 것이 하나 이상일 때, 그 혼합을 최적화하는 대신 사용자에게 물어보는 것이다. 어떤 의미에서 A가 데이터를 분류하기에 더 '단순한' 개념이라 하더라도, B 역시 데이터를 분류하는 '매우 그럴듯한' 방법이라는 점을 알아차리고 사용자에게 A를 의미했는지 B를 의미했는지 물어야 한다. 여기서의 목표는 탱크 사진이 탱크가 아닌 사진보다 더 어두운 조명에서 촬영되었던 고전적인 '탱크 분류기' 문제에서, 사용자에게 "탱크를 탐지하려는 건가요, 어두운 조명을 탐지하려는 건가요, 아니면 '탱크이면서 어두운 조명'을 탐지하려는 건가요, 그것도 아니면 무엇인가요?"라고 묻는 무언가를 만드는 것이다.

안전한 결과 예측 및 서술

어떤 행동에 대해 AI가 예측한 결과를 사용자에게 전달하되, 사용자를 최대한 효과적인 의사소통을 위한 무방비한 argmax 안에 놓지 않는 것이다.

능력 회피

예를 들어 행동주의 지니를 만들려면, AI가 마음을 모델링하는 능력을 키우거나 마음 모델링 문제를 하위 에이전트에게 넘기는 등의 도구적 유인을 경험하지 않도록 해야 한다. 일반적인 하위 문제는 '현실의 특정 측면을 잘 모델링하게 되려는 도구적 압력을 피하는 것'일 수 있다. 장난감 문제로는, 웜푸스 문제에서 전반적으로 금을 얻고 싶어 하지만 특히 오른쪽 위 모서리 칸의 상태를 알려는 도구적 압력은 경험하지 않는 AI를 생각해 볼 수 있다.

Backlinks1