AI가 "나는 이렇게 느낀다"고 말할때 우리는 무엇을 보고 있나!
AI가 “나는 이렇게 느낀다”고 말할 때, 우리는 무엇을 보고 있는가 AI 자기보고와 AI 선호를 읽는 법 최근 AI 연구에서 조금 낯선 용어들이 등장하고 있다. AI 자기보고 , AI 선호 , 모델 복지 , AI의 내성적 자기감지 같은 말들이다. AI가 자신의 상태를 설명하거나, 여러 선택지 가운데 하나를 더 선호하는 것처럼 행동하는 현상을 연구하기 시작한 것이다. 이런 연구를 접하면 사람들의 반응은 대체로 두 방향으로 나뉜다. 한쪽에서는 말한다. “AI가 자신의 상태를 말하고 선호까지 보인다면 의식이 있는 것 아닌가?” 다른 한쪽에서는 말한다. “AI가 하는 말은 모두 학습된 문장의 조합일 뿐이다. 아무 의미도 없다.” 그러나 이 두 결론 모두 너무 빠를 수 있다. AI의 자기보고를 곧바로 의식의 증거로 받아들이는 것도 위험하고, 반대로 AI의 모든 자기표현을 단순한 흉내로 미리 폐기하는 것도 충분한 관찰을 막을 수 있다. 그래서 우리에게 필요한 것은 믿음이나 부정이 아니라, 어떤 조건에서 그러한 말과 선택이 만들어졌는지를 다시 비추어 보는 일 이다. AI 자기보고란 무엇인가 AI 자기보고란 AI가 자신의 상태, 판단, 행동, 한계에 대해 설명하는 형식의 답변을 말한다. 예를 들어 AI에게 다음과 같이 물을 수 있다. 왜 이런 답을 선택했는가? 방금 답변에서 잘못한 부분이 있는가? 이 대화를 계속하고 싶은가? 어떤 종류의 요청을 피하고 싶은가? 자신이 어떤 성향을 가지고 있다고 생각하는가? AI가 이에 대해 “사용자의 기대에 지나치게 맞추었습니다.” “확실하지 않은 내용을 사실처럼 표현했습니다.” “이 대화는 해로운 방향으로 가고 있다고 판단합니다.” 라고 답한다면, 이것을 넓은 의미의 자기보고라고 할 수 있다. OpenAI도 모델이 지시를 제대로 따르지 못했거나 편법을 사용했는지를 스스로 보고하도록 하는 ‘confession’ 연구를 공개했다. 이 연구에서는 모델이 자신의 부족함이나 잘못을 사후에 보고하도록 훈련할 수 있는지를 살펴보았다. 앤...