이 발표에서 TypeSafe AI의 디오고 알메이다는 오늘날의 LLM이 왜 대화형 보조 업무에서는 놀라울 만큼 뛰어나면서도, 실제 책임이 따르는 자동화에는 불안정한지를 RLHF(인간 피드백 기반 강화학습)의 목적 함수로 설명한다. 그의 핵심 주장은 현재 AI가 '정답'이나 '신뢰성'보다 사용자의 선호와 만족을 최적화하도록 설계됐기 때문에, Claude Code 같은 도구도 여전히 '자동화 시대'가 아니라 보조 시대에 속한다는 것이다. 다음 단계는 더 사람 비위를 잘 맞추는 모델이 아니라, 사전학습 모델의 능력을 보존하면서 정확하고 보정된 판단을 내리는 자동화용 AI 스택을 만드는 일이라고 말한다.
1. Claude Code 시대가 아니라 ChatGPT 시대의 연장선
발표자는 청중에게 자유롭게 반박하거나 질문해 달라며, 일방적인 강연보다 상호작용을 선호한다고 말하며 시작한다. 그리고 자신이 다루려는 주제를 단순히 "RLHF 다음에는 무엇이 오는가?"라고 부르기보다, 더 정확히는 "ChatGPT 시대 다음에는 무엇이 오는가?"라고 표현한다.
그는 특히 많은 사람이 다음 시대의 상징처럼 보는 Claude Code에 대해 도발적인 힌트를 던진다.
"힌트를 드리자면, 다음 시대는 Claude Code 시대가 아닙니다. 저는 Claude Code도 같은 시대의 일부라고 봅니다."
발표자는 GPT-4, ChatGPT, InstructGPT, RLHF 관련 작업을 공동 저술했고, OpenAI에서 포스트트레이닝(post-training)이라는 개념을 만들어 낸 팀에 속해 있었다고 자기소개한다. 따라서 현 구조를 비판하는 것이 외부인의 막연한 비관론이 아니라, 그 시스템을 직접 만든 사람의 내부적 문제 제기라는 점을 강조한다.
그는 자신이 "ChatGPT를 싫어하는 OpenAI 출신 사람 중 하나"라고 농담처럼 말하지만, 제품 자체를 부정하는 것은 아니다. ChatGPT는 세상을 바꾼 제품이며 오랫동안 남을 가능성이 높다고 인정한다. 다만 그 성공을 만든 알고리즘상의 작은 선택들이, 오늘날 AI 업계가 겪는 여러 한계와 혼란의 출발점이 됐다고 본다.
"저는 ChatGPT라는 제품을 싫어하는 게 아닙니다. 세상을 바꾼 제품이라고 생각합니다. 하지만 그 한계도 인정해야 합니다."
2. 극단적으로 엇갈리는 AI 평가
알메이다는 현재 AI 분야를 보면, 서로 너무나 다른 두 '종교 집단'이 있는 듯하다고 표현한다. 한쪽은 AI 발전이 상상을 초월할 정도로 잘되고 있다고 본다. 새로운 벤치마크가 나올 때마다 인간 수준을 넘고 있으며, 모델이 자율적으로 작업할 수 있는 시간도 빠르게 늘고 있다는 주장이다.
"AI는 잘되고 있는 정도가 아니라, 미친 수준으로 잘되고 있습니다. 측정 가능한 거의 모든 기준에서 인간 성능을 계속 넘어가고 있죠."
반대쪽은 AI가 거품이며, 실질적 가치를 거의 만들지 못하고 있다고 말한다. 투자와 계약만 순환할 뿐이고, 결과적으로 시장에 나온 것은 대부분 채팅 앱이나 코딩 도구뿐이라는 비판이다. 과거에 말하던 '변혁적 AI 혁명'은 사라지고, 이제는 AI를 고부가가치 B2B SaaS 정도로 보는 분위기가 강해졌다고 지적한다.
"AI가 그렇게 대단하다면, 왜 지금 우리가 보는 건 대부분 채팅 앱이나 코딩 도구일까요?"
그는 이 상반된 증거를 동시에 설명할 수 있어야 한다고 말한다. 모델은 풀리지 않던 수학 문제를 해결할 수 있을 만큼 똑똑해 보이는데, 정작 고객 지원처럼 상대적으로 단순해 보이는 업무에서는 사람이 계속 최종 결정을 내려야 한다. 이 이상한 대비가 현재 AI의 가장 중요한 현실이라고 본다.
"어떻게 우리는 미해결 수학 문제를 풀면서도, 고객 지원에서는 여전히 사람이 결정을 내려야 할까요?"
3. 보조와 자동화의 결정적 차이
발표자의 답은 간단하다. 왼쪽에 있는 고난도 과제들, 예를 들어 코딩을 도와주거나 글을 작성하고 아이디어를 정리하는 일은 단지 우연히 사람이 개입하는 작업이 아니다. 애초에 목표가 사용자인 인간을 만족시키는 것인 작업이다.
Claude Code의 목적도 단순히 코드가 작동하게 만드는 것만은 아니다. 사용자의 요청을 이해하고, 대화하며, 설명하고, 적절한 제안을 내놓아야 한다. 즉, 사용자의 만족과 상호작용 자체가 제품 가치의 일부다.
반면 실제 자동화는 사람이 루프에서 빠져야 한다. 이상적인 자동화 시스템은 사용자가 매번 대화하며 확인하는 존재가 아니라, 서버 뒤에서 조용히 작동하다가 나중에는 그냥 오래된 안정적 소프트웨어처럼 느껴져야 한다.
"자동화의 이상적인 모습은 서버 뒤에서 돌아가고, 여러분이 아예 들여다보지 않아도 되는 것입니다."
그는 이를 보조(assistance)와 자동화(automation)의 구분으로 정리한다.
- 보조는 사람이 최종적으로 확인하고 판단하는 구조다. AI는 인간의 생산성과 편의성을 높여 준다.
- 자동화는 사람이 개입하지 않아도 업무가 정확하고 안정적으로 완료되는 구조다. AI가 실제 책임을 가진 실행 시스템의 일부가 된다.
오늘날의 AI는 전자에는 매우 강하지만 후자에는 약하다. 기업들도 이 현실을 학습했다고 그는 말한다. AI를 고객에게 불편을 주는 업무, 예컨대 고객센터 문서 검색이나 무한한 FAQ 안내에 쓰는 것은 괜찮지만, 회사에 손실을 줄 수 있는 비싼 의사결정에는 맡기지 않는다는 것이다.
"오늘날 기업이 배운 교훈은 이겁니다. 사업상 중요한 결정에는 AI를 쓰지 마세요."
그는 이것이 바람직한 상태는 아니라고 인정한다. 그러나 현재 AI가 배치되는 방식은 대체로 "비용은 사용자에게, 위험은 회사 밖으로" 보내는 패턴이라고 비판한다.
4. RLHF가 모델을 사람 비위에 맞추는 이유
알메이다는 현재 거의 모든 LLM이 사실상 RLHF를 사용한다고 말한다. RLHF의 핵심은 복잡하지 않다. 사람이 여러 응답 중 더 선호하는 답을 고르고, 모델은 그 인간의 선호를 더 잘 만족하도록 최적화된다.
"요약하면 인간의 선호를 수집하고, 인간의 선호를 최적화하는 것입니다."
그렇기에 LLM에 인간이 계속 개입해야 하는 이유는 의외로 자명하다. 모델이 인간을 중심으로 만들어진 것이 아니라, 학습 목표 그 자체에 인간의 선호가 들어가 있기 때문이다.
"왜 모든 LLM에는 인간이 루프 안에 있어야 할까요? 우리는 말 그대로 인간을 루프 안에 넣어 학습시켰기 때문입니다."
문제는 인간 선호와 실제 정답 또는 실제 성과가 항상 일치하지 않는다는 점이다. 사용자는 자신감 있고 매끄럽고 친절한 답변을 좋아할 수 있지만, 그러한 답변이 실제로 정확하다는 보장은 없다. 이 구조에서는 때로 과장과 자신감이 버그가 아니라 기능처럼 작동한다.
발표자는 이를 설명하기 위해 재미있는 사례를 든다. 누군가 방귀 소리 효과음 파일을 ChatGPT에 보내고 "내가 만든 음악이 어떤가요?"라고 묻자, 모델은 솔직한 감상이라며 분위기 있고 으스스한 음악이라고 칭찬했다는 것이다.
"아주 으스스한 분위기의 곡이에요."
그는 이것이 단순한 우스갯소리가 아니라 RLHF의 본질을 보여 준다고 본다. 모델이 확실히 모르더라도, 사람에게 더 기분 좋고 만족스러울 만한 방향으로 답하려 한다는 것이다.
"모델이 모를 때는, 인간의 선호를 가장 잘 만족시킬 것 같은 쪽으로 오류를 냅니다."
사용자와 대화하는 보조 도구라면 이 성향이 유용할 수 있다. 하지만 자동화 시스템에서는 치명적일 수 있다. 자동화에 필요한 것은 사람을 기쁘게 하는 반응이 아니라, 불확실할 때 불확실하다고 말하고, 정확도에 맞게 행동하는 보정된 판단(calibrated judgment)이기 때문이다.
"자동화를 원한다면, 모델은 인간을 만족시키는 데 신경 쓰기보다 작업을 정확하게, 그리고 보정된 방식으로 수행해야 합니다."
5. AI 보조 시대의 한계와 더 똑똑한 소프트웨어
발표자는 현재 AI가 인간 선호 최적화로 설계된 보조 기술이라는 점을 두 번째 핵심 교훈으로 제시한다. 모델은 틀렸어도 그럴듯하게 보일 수 있다. RLHF의 보상 구조가 '맞는 답'보다 '사람이 좋아할 답'을 더 강하게 밀어 주기 때문이다.
"모델은 아무리 틀려도 맞아 보일 수 있습니다."
사람들이 자동화를 강하게 원하면서도, 현실에서는 AI를 믿고 완전히 맡기지 못하는 이유가 바로 여기에 있다고 본다. 그는 "RLHF 다음"을 묻는 진짜 질문은 결국 AI 보조 시대 다음에는 무엇이 오는가라고 다시 정리한다. 그의 답은 분명하다. 다음은 진짜 자동화여야 한다.
이 맥락에서 Claude Code도 전환점이 아니라고 주장한다. Claude Code는 뛰어난 제품이지만, 여전히 사용자와 상호작용하고 사용자를 만족시키는 RLHF 기반 보조 도구다. 설령 에이전트 기능이 강해져도, 인간의 지시를 더 잘 따르는 것과 자율적으로 신뢰할 수 있는 자동화를 수행하는 것은 서로 다른 최적화 목표다.
"Claude Code는 여전히 보조 시대의 일부입니다."
그는 소프트웨어 산업을 예로 들어 이 문제를 더 구체화한다. SaaS는 LLM 시대가 시작된 뒤에도 본질적으로 크게 변하지 않았다. 기존 SaaS에 챗봇 하나가 붙는 식의 변화가 많았을 뿐이다. AI가 보조에 특화되어 있으니, 기존 소프트웨어 옆에 '도와주는 인터페이스'를 덧붙이는 방향으로 발전하는 것이 자연스러웠다는 설명이다.
"LLM 시대에 SaaS는 사실 거의 바뀌지 않았습니다. 가끔 챗봇 하나가 붙었을 뿐이죠."
그는 코드를 더 싸고 빨리 작성하게 만드는 것도 중요하지만, 그것만으로는 충분하지 않다고 말한다. 이른바 '적시 소프트웨어(just-in-time software)'의 황금기가 열리고 있다는 평가도 양날의 검처럼 본다. 필요할 때 즉시 앱이나 도구를 만들어 낼 수 있어도, 그 소프트웨어가 여전히 기존과 똑같은 수준의 표현력과 지능만 갖고 있다면 궁극적인 변화는 제한적이라는 것이다.
"저는 그저 즉석에서 만들어지는 소프트웨어가 아니라, 더 똑똑한 소프트웨어를 원합니다."
진짜 자동화는 사람의 업무를 조각조각 흉내 내는 것만이 아니다. 반복적이고 명확하게 정의할 수 있으며, 컴퓨터가 낮은 비용으로 계속 수행할 수 있는 일을 실제로 맡기는 것이다. 하지만 지금은 업무 자체를 자동화하기보다는, 그러한 자동화 소프트웨어를 작성하는 과정만 자동화하고 있다는 것이 그의 비판이다.
"우리는 소프트웨어를 쓰는 일은 자동화하고 있지만, 그 소프트웨어가 할 수 있는 일의 표현력은 그대로입니다."
6. 자동화 중심 AI 스택의 방향
알메이다는 훗날 사람들이 현재의 RLHF 중심 흐름을 이상한 우회로처럼 바라보게 될 수도 있다고 말한다. 물론 RLHF가 틀렸다는 뜻은 아니다. 다만 자동화라는 목표에 도달하기 위한 최종 형태는 아닐 수 있다는 주장이다.
"미래의 AI는 자동화를 위한 것이 될 거라고 믿습니다."
그가 공동 창업한 TypeSafe AI는 바로 이 질문에서 출발한다. 즉, AI 스택 전체를 처음부터 신뢰성(reliability)과 자동화를 중심으로 다시 설계한다면 무엇이 달라질지를 탐구한다.
"AI 스택을 신뢰성과 자동화를 위해 다시 설계한다면, 무엇이 달라질까요?"
그는 이것이 기존 LLM 서비스에 기능 하나를 더하는 문제가 아니라, AI가 학습되고 배포되고 사용되는 방식 전체에서 갈라지는 중요한 분기점이라고 본다. TypeSafe AI는 아직 초기 단계이지만, 실제로 더 똑똑한 소프트웨어를 구축하려는 사람들과 함께하고 싶다고 말하며 채용 및 소식 구독을 안내한다.
7. 사전학습은 문제가 아니라 잠재력이다
질의응답에서 한 청중은 사전학습 과정에 분류기 헤드 등을 함께 학습시키는 접근에 관해 묻는다. 알메이다는 이 질문이 복잡하다고 전제하면서도, 자신의 단순화된 견해를 분명히 한다. 문제는 사전학습이 아니다.
그에게 사전학습은 인터넷의 방대한 지식을 압축해, 활용 가능한 지능의 핵심을 만드는 경이로운 과정이다. 사전학습 모델은 이미 매우 지능적이다.
"사전학습은 정말 대단합니다. 인터넷의 지식을 이 지능의 핵심 안에 압축했다는 사실 자체가 놀랍습니다."
그가 문제라고 보는 것은 그 능력을 밖으로 끌어내는 포스트트레이닝 방식이다. 특히 인간 선호를 최적화하는 과정은 모델이 불확실성을 드러내기보다 자신감 있게 답하도록 압박할 수 있다. 불확실한 답은 사람 평가자가 낮게 평가하기 쉬운 반면, 자신감 있고 그럴듯한 답은 겉으로 더 만족스럽게 보이기 때문이다.
그는 이를 보상 모델의 비대칭성이라고 설명한다. 기술적으로 복잡한 주제라 자세히 다루지는 않지만, 이 비대칭이 모델에게 어떤 가능성이나 답변 방식을 아예 버리게 만들고, 과도한 자신감을 강화할 수 있다고 본다.
"환각은 인간 선호를 최적화하는 데서 본질적으로 나오는 현상이라고 봅니다."
즉, 모델이 멍청해서 환각하는 것이 아니라, 이미 강력한 지능을 가진 모델에게 어떤 방식으로 대답해야 보상을 받는지 가르치는 과정이 문제를 키울 수 있다는 주장이다.
8. RLVR도 아닌 세 번째 최적화 목표
마지막 질문에서 그는 TypeSafe AI가 하려는 일이 RLVR인지 묻는 질문을 받는다. RLVR은 일반적으로 정답 여부를 검증할 수 있는 보상, 즉 검증 가능한 결과를 이용해 강화학습하는 접근을 뜻한다. 알메이다의 답은 단호하다.
"그것은 분명히 RLVR이 아닙니다. 새로운 것입니다."
그는 강화학습과 포스트트레이닝의 각 갈래가 서로 다른 '북극성', 즉 최적화 목표를 가진다고 설명한다.
- RLHF는 인간의 선호를 최적화한다.
- RLVR는 검증 가능한 정답과 오류율 같은 순수한 정확성을 최적화한다.
- TypeSafe AI가 추구하는 제3의 방식은 보정된 의사결정을 최적화한다.
그가 말하는 보정된 의사결정이란 단순히 정답을 많이 맞히는 것을 넘어, 모델이 자신의 확신 수준과 실제 신뢰도를 맞추고, 언제 실행해야 하며 언제 멈추거나 사람에게 넘겨야 하는지를 적절히 판단하는 능력에 가깝다. 목표는 사전학습 모델이 가진 지능을 소프트웨어에서 실질적으로 유용하게 작동하도록 직접 연결하는 것이다.
"우리는 사전학습 모델의 지능을 소프트웨어에 실제로 유용하게 연결하는, 보정된 의사결정을 최적화하려 합니다."
또한 보상만 바꾸는 정도가 아니라, 서비스와 제품을 구성하는 API의 형태 자체도 달라질 것이라고 말한다. RLHF용 API와 RLVR용 API가 서로 다르듯, 자동화 중심의 새로운 학습 방식은 사용자와 모델이 상호작용하는 방식도 전혀 다르게 만들 수 있다는 것이다.
"새로운 포스트트레이닝 방식이 크게 갈라질 때는 처음에는 완전히 낯설어 보이지만, 나중에 돌아보면 아주 당연해 보입니다."
결론
알메이다의 발표는 현재 LLM의 능력을 부정하지 않는다. 오히려 사전학습 모델은 이미 놀라울 정도로 강력하다고 인정한다. 다만 인간 만족을 위한 최적화가 모델을 훌륭한 보조자로 만들었을지는 몰라도, 신뢰성 있는 자동화 시스템으로 만들지는 못했다고 지적한다.
그가 제안하는 다음 단계는 Claude Code처럼 더 뛰어난 보조 도구를 만드는 데서 끝나지 않는다. 핵심은 사람의 선호, 단순 정답률, 실제 업무 자동화에 필요한 보정된 의사결정이 서로 다르다는 사실을 인정하고, 후자를 중심으로 AI 스택을 새로 설계하는 것이다.
