
주판, 톱니바퀴, 종이테이프, 반도체에서 신경망과 열린 지평으로 이어지는 모습. AI로 제작한 독창적인 개념 삽화이며, 역사 현장을 촬영한 사진이 아니다.
주판 하나를 오늘날의 컴퓨터 옆에 놓으면, 둘 사이에는 통하는 말이 없어 보인다. 한쪽은 손가락으로 알을 움직여야 하고, 다른 쪽은 코드를 쓰고 사진을 알아보며 사람 대신 소프트웨어까지 조작한다. 하지만 둘이 답하려는 질문은 같다. 머릿속에서 하는 일을 머리 밖으로 옮길 수 없을까?
주판은 숫자의 자릿값을 도구 위에 놓았다. 컴퓨터는 규칙의 실행을 기계에 맡겼다. 머신러닝은 거기서 한 걸음 더 나아갔다. 규칙을 사람이 전부 써놓지 않아도, 기계가 사례에서 배울 수 있게 된 것이다. 대규모 언어 모델과 Agent에 이르러 사람들은 일 자체를 맡기기 시작했다. 답을 묻는 데 그치지 않고, 자료를 찾고 프로그램을 쓰고 오류를 고쳐 결과를 내놓을 때까지 일을 넘긴다.
이 길은 곧지 않았다. 과장된 약속, 연구비의 썰물, 오랜 정체를 겪었다. 그러면서도 그다지 눈에 띄지 않는 작업들이 걸음을 이어갔다. 더 나은 통계 방법, 더 큰 데이터셋, 더 저렴한 반도체, 더 믿을 만한 소프트웨어가 그것이다. 오늘의 갑작스러운 가속은 그런 축적이 한꺼번에 힘을 발휘한 결과다.
이 글은 2026년 10월 9일에 썼다. 앞부분은 이미 일어난 역사를 다루고, 뒷부분은 도달 시점에 통일된 합의가 없는 AGI의 미래를 내다본다. 과감하게 어느 해에 걸어보겠지만, 그 예측을 사실로 쓰지는 않겠다.
인류는 먼저 숫자를 머리 밖에 놓는 법을 배웠다
주판은 이 이야기의 출발점으로 삼을 만하다. 다만 “인류가 처음 자리올림 체계를 발명한 곳”이라고 부르는 것은 적절하지 않다. 고대의 계산판, 산가지, 알을 쓰는 주판은 하나의 큰 계보에 속한다. 처음 생겨난 일과 이후 변화한 일도 같지 않다.중국의 주판은 서기 1300년 무렵부터 산가지를 점차 대신했다. 일의 자리, 십의 자리, 백의 자리가 각각 자리를 얻었고, 자리올림을 기억에만 의존할 필요가 없어졌다. 중요한 것은 자릿값 계산을 눈에 보이고 손으로 만질 수 있는 동작으로 만들었다는 점이다.[1]
이진법은 다른 문제에 답했다. 두 가지 상태만으로 모든 수를 나타낼 수 있을까? 라이프니츠는 1703년에 이 산술을 체계적으로 설명했다. 이후의 전자회로는 안정된 두 상태를 구분하는 데 능했다. 이진법은 그렇게 현대 계산의 바탕이 되었다. 하지만 이진법 자체가 생각하는 것은 아니다. 기계가 저장하고 다루기 편한 표현 방식을 제공할 뿐이다.[2]
배비지는 1834년에 해석기관을 구상하기 시작했다. 연산, 기억, 프로그램 제어를 하나의 설계에 담았다. 기계는 생전에 완성되지 못했지만, 생각은 남았다. 1843년에 에이다 러브레이스가 발표한 주석은 기계가 정해진 단계에 따라 기호를 처리할 가능성을 더 깊이 논의했다. 기계가 무엇을 처리할 수 있는지는 톱니바퀴나 회로만으로 결정되지 않는다. 우리가 문제를 프로그램으로 표현할 수 있는지에도 달려 있다.[3] CHM

계산의 역사를 고대, 1703—1956, 1957—2017, 2022—2026의 네 시기로 나눴다. 사건은 연대순이며 간격은 실제 경과 시간을 뜻하지 않는다. 아래 점선 영역은 2031년에 대한 주관적 예상과 2028—2035년의 관찰 구간이며, 이미 일어난 사건이 아니다. 그림의 명칭은 아래 연표와 대응한다.
| 시기 | 이정표 | 무엇을 남겼나 |
|---|---|---|
| 고대; 약 1300년 | 계산판, 산가지, 주판 | 계산을 외부 도구의 도움으로 할 수 있다. 자릿값과 자리올림이 직접 조작할 수 있는 동작이 되었다.[1] |
| 1703년 | 라이프니츠가 이진법을 체계적으로 설명 | 두 기호로 수를 나타내어, 이후 디지털 회로에 적합한 표현 방식을 제공했다.[2] |
| 1834년; 1843년 | 해석기관 구상; 러브레이스의 주석 | 연산, 기억, 프로그램 제어가 결합하기 시작했고, 프로그램에 대한 상상은 개별 산술을 넘어섰다.[3] CHM |
| 1854년 | 불 대수 | 논리를 대수로 표현할 수 있게 되었고, 이후 디지털 회로를 분석하는 중요한 사상적 도구가 되었다.[4] |
| 1936년 | 튜링이 추상적인 계산 모델을 제안 | 튜링 머신은 “규칙에 따라 계산한다”는 일을 형식화하고, 계산에 한계가 있음도 보여주었다.[5] |
| 1938년 | Shannon의 스위칭 회로 논문 | 불 논리와 릴레이 회로의 관계가 이어졌다.원논문 |
| 1943년 | McCulloch와 Pitts의 인공 뉴런 모델 | 신경 활동과 논리 연산 사이에 영향력 있는 수학적 연결이 생겼다.원논문 |
| 1950년 | 튜링이 「계산 기계와 지능」을 발표 | 기계가 생각할 수 있는가라는 질문을, 관찰 가능한 상호작용의 모습으로 돌렸다.논문 전문 |
| 1955년; 1956년 | 다트머스 제안서; 여름 연구 프로젝트 | “인공지능”이 연구 계획의 이름이 되고, 이후 하나의 분야가 되었다.[6] |
| 1957년; 1958년 | FORTRAN; Lisp | 앞의 언어는 과학 계산을 발전시켰고, 뒤의 언어는 초기 AI의 중요한 프로그래밍 언어가 되었다.[7][8] |
튜링 머신은 곧바로 쓸 수 있는 지능형 컴퓨터가 아니다. 유한한 규칙에 따라 계산을 실행한다는 것이 무엇인지 알려주는 추상적인 모델이다. 튜링의 1936년 연구도 “어떤 문제든 결국 계산해서 풀 수 있다”는 보장을 주지는 않았다. 이 점을 이해하는 것이 중요하다. 이후 AI가 거둔 성공들은 문제 자체에 있는 한계를 없애지 않았다.[5]
1950년대에 연구자들은 기계의 목표를 “빠르게 계산하기”에서 “지능이 있는 것처럼 행동하기”로 넓히기 시작했다. 다트머스 제안서는 1955년에 쓰였고, 연구 프로젝트는 1956년 여름에 열렸다. 현대 AI의 중요한 출발점이지만, 인류가 처음 인공 지능을 상상한 순간은 아니다. 이후 프로그래밍 언어 덕분에 연구자들은 저수준 명령을 일일이 만질 필요가 줄었고, 기호, 탐색, 추론에 더 많은 힘을 쏟을 수 있었다.[6][7][8]
기계는 보고 듣는 법, 그리고 짐작하는 법을 배웠다
초기 AI는 규칙을 믿었다. 전문가의 지식을 넣기만 하면 기계가 질병을 판단하고 문장을 이해하고 장비를 제어할 수 있을 것 같았다. 어려움은 곧 드러났다. 현실에는 예외가 너무 많았고, 상식을 전부 적어 넣기도 어려웠다. 규칙 기반 시스템이 사라진 것은 아니지만, 연구의 무게중심은 점차 더 현실적인 방법으로 이동했다. 기계에 충분한 사례를 주고 불확실한 상황에서 판단하도록 배우게 하는 방법이다.
이미지 인식은 화소에서 사물을 구별하는 방법을 연구한다. 음성 인식은 소리를 글자로 바꾸는 방법을 연구한다. 자연어 처리, 곧 NLP는 언어의 구조와 의미, 쓰임을 어떻게 다룰지 연구한다. 이 분야들은 오랫동안 각자의 길을 걸었고, 나중에야 딥러닝과 멀티모달 모델 안에서 서서히 합류했다.
| 시기 | 이정표 | 무엇을 남겼나 |
|---|---|---|
| 1952년 | 벨 연구소의 숫자 음성 인식 시스템 Audrey | 제한된 조건에서 기계가 소리로 숫자를 알아볼 수 있었다. 오늘날의 자유로운 대화와는 거리가 멀었다.CHM 역사 기록 |
| 1958년 | Rosenblatt의 퍼셉트론 논문 | 학습 사례로 매개변수를 조정하는 일이 초기 머신러닝의 중요한 경로가 되었다.[10] |
| 1959년 | Samuel의 체커 머신러닝 논문 | 기계는 경험을 통해 성능을 높일 수 있다. 알고리즘과 학습 목표는 여전히 사람이 설계해야 한다.[9] |
| 1966년 | ELIZA | 단순한 텍스트 규칙만으로도 사람에게 이해받는 느낌을 줄 수 있다. 대화의 유창함은 실제 이해와 같지 않다.[11] |
| 1966년 | MIT 여름 시각 프로젝트 | 연구자들은 이미지의 구조를 기계가 다룰 수 있는 서술로 바꾸려 했고, 나중에 예상보다 훨씬 어렵다는 사실을 알게 되었다.프로젝트 원문 |
| 1970—1980년대 | AI 침체와 전문가 시스템의 흥망 | 기대, 계산 능력, 실제 성능이 어긋났다. AI의 발전은 계속 상승하는 곡선이 아니었다.[12] CHM |
| 1986년 | 역전파의 대표 논문 | 다층 신경망을 효과적으로 학습시키는 방법이 더 큰 영향력을 얻었다. 관련 생각이 이 해에 처음 등장한 것은 아니다.[13] |
| 1980—1990년대 | 통계적 음성 인식과 통계적 NLP | 확률로 모호함과 잡음을 다루면서, “모든 규칙을 다 써넣는다”는 기대를 점차 대신했다.음성 인식 종설; 통계적 번역 논문 |
| 1995년 | Cortes와 Vapnik의 서포트 벡터 머신 논문 | 제한된 표본에서 견실한 분류 경계를 구성하는, 머신러닝의 중요한 도구가 되었다.[14] |
| 1997년 | Deep Blue가 카스파로프를 이기다 | 전용 시스템은 최정상 기사를 넘어설 수 있다. 하지만 기량이 저절로 범용 능력으로 바뀌지는 않는다.[15] |
| 1998년 | LeNet의 대표 논문 | 합성곱 신경망이 손으로 쓴 숫자와 문서 인식 같은 작업에서 실용성을 보여주었다.[16] |
| 2000—2010년대; 2013년 | 광고 클릭률 예측의 대규모화; Google의 대표 논문 | 머신러닝이 실시간 상업적 의사결정에 들어가고, 방대한 피드백 속에서 예측을 개선했다.[19] |
| 2009년; 2012년 | ImageNet 데이터셋; AlexNet | 대규모 데이터, GPU, 깊은 신경망이 합류해 이미지 인식에 뚜렷한 돌파구가 생겼다.[17][18] |
| 2012년 | 심층 신경망 음성 인식 종설 | 딥러닝이 음향 모델링을 바꾸면서, 음성 시스템은 새로운 개선 단계에 들어갔다.연구 종설 |
| 2014년 | GAN | 적대적 학습이 생성 모델의 경로를 넓혔다.원논문 |
| 2016년; 2017년 | AlphaGo가 이세돌을 이기다; 커제를 이기다 | 심층 신경망, 탐색, 강화학습을 결합해 이전에는 매우 어려웠던 바둑 과제를 공략했다.[20] BGA |
| 2017년 | Transformer | 어텐션 메커니즘이 병렬 학습에 더 적합한 구조를 제공해, 이후 대규모 언어 모델의 핵심 기반이 되었다.[21] |
| 2018년 | BERT | 양방향 사전학습이 언어 이해 과제를 발전시켰고, 모델들이 더 범용적인 언어 표현을 공유하기 시작했다.원논문 |
| 2020년 | GPT-3 | 소수 사례를 제시하는 프롬프트가 대규모 모델의 문맥을 통한 다양한 과제 수행 능력을 보여주었다. 신뢰성의 한계는 남았다.[22] |
| 2020년 | DDPM | 잡음 제거 확산 모델이 이미지 생성을 발전시켰다. 모든 확산 개념의 출발점은 아니다.원논문 |
| 2020년; 2021년 | AlphaFold의 CASP14 돌파; 방법 논문 | 단백질 구조 예측에 큰 진전이 있었다. 구조 예측이 곧 신약 검증의 완료를 뜻하지는 않는다.원논문 |
서포트 벡터 머신, 곧 SVM은 그 시대의 기질을 잘 보여준다. 오늘 같은 채팅창이 없어도 머신러닝은 진지하고 구체적인 문제를 풀 수 있었다. 스팸 메일을 알아보고 이미지의 범주를 판단하는 일은, 기계가 생각을 한다고 선언하는 것보다 유용한 경우가 많았다.[14]
광고 클릭률 예측은 그런 능력을 산업 규모로 밀어 올렸다. 시스템이 추정하는 것은 “이 문맥에서 이번 광고 노출이 클릭될 확률”이며, 흔히 CTR이라고 쓴다. 독심술도 아니고, 특정 이용자가 반드시 클릭한다고 보장하지도 않는다. 확률은 보정해야 한다. 시스템은 분포의 변화, 개인정보 보호의 제약, 피드백 편향에도 부딪힌다. 중요한 이유는 머신러닝이 여기서 지속적으로 작동하며 수익과 정보 유통에 영향을 주는 순환 안으로 들어갔기 때문이다.[19]
2012년의 이미지 인식 돌파는 많은 사람이 신경망을 다시 믿게 했다. 2016년의 AlphaGo는 그 변화를 대중의 시야에 들여왔다. 당시 4:1은 이세돌과의 다섯 판 도전 대국 결과이지, 세계선수권 대회의 우승 타이틀이 아니다. 2017년 커제와의 세 판 대결은 3:0이었다. 결과는 그 자체로 충분히 놀랍다. 부정확한 “우승”을 덧붙일 필요는 없다.[18][20] BGA
ChatGPT 이후, 질문은 답변에서 일의 완수로 바뀌었다
2022년 11월 30일, ChatGPT가 대중에게 공개되었다. 중요한 것은 모델이 더 강해졌다는 사실만이 아니었다. 보통 사람들도 문턱이 매우 낮은 입구를 얻었다. 프로그래밍을 몰라도 그냥 말하면 기계가 설명하고 고쳐 쓰고 번역하고 프로그램을 만들 수 있었다. AI는 여러 제품 뒤에 숨어 있던 능력에서, 사람들이 직접 사용하는 대상으로 바뀌었다.[23]
그 뒤의 변화는 빠르게 채팅창을 넘어갔다. 모델은 더 많은 자료를 읽고, 검색, 파일, 코드 실행기, 브라우저와도 연결되기 시작했다. 여기서 Agent는 모델을 중심으로 구성한 실행 시스템을 뜻한다. 작업 상태를 저장하고 도구를 호출하며 결과를 확인한 다음, 다음 행동을 결정한다. 모델이 추론을 맡고 실행 시스템이 그 추론을 현실에 연결한다. 둘 다 틀릴 수 있다.

2022—2026년의 최근 시간축은 연도를 선형 좌표로 표시한다. ChatGPT, vibe coding, Claude Code, Manus, OpenClaw의 이정표가 뚜렷하게 가까이 모여 있다. 이 글에서 고른 사건만 수록했으며, 이정표의 수는 범용 지능 점수가 아니다. 월만 확인된 사건은 월 중간에 배치했으며 특정 날짜가 확인됐다는 뜻은 아니다.
| 시기 | 이정표 | 어떻게 이해해야 하나 |
|---|---|---|
| 2022년 11월 30일 | ChatGPT 공개 출시 | 자연어가 대중이 생성형 AI를 쓰는 입구가 되었다.[23] |
| 2025년 2월 | “vibe coding”이라는 말이 퍼지다 | Karpathy가 생성된 코드에 크게 의존하며 한 줄씩 이해하는 일을 덜 중시하는 방식을 설명했다. 모든 AI 보조 개발을 통칭하는 말은 아니다.원글 미러 |
| 2025년 2월 24일 | Claude Code 연구 프리뷰 | 코딩 도우미가 터미널로 들어와, 코드베이스와 도구를 활용해 일할 수 있게 되었다.[24] |
| 2025년 3월 | Manus가 처음 공개적으로 등장 | 여러 단계를 거쳐 결과물을 내는 Agent 제품이 “나 대신 끝내줘”라는 요구를 전면에 내세웠다.[25] |
| 2026년 1월 | OpenClaw로 이름 변경 및 확산 | 직접 관리하는 개인 Agent의 메시지 창구, 지속되는 상태, 도구 연결이 주목받았다. 새로운 기반 모델이 아니라 실행 시스템이다.[26] |
Claude Code와 vibe coding은 같은 문장에 자주 등장하지만, 같은 것은 아니다. 앞의 것은 도구이고 뒤의 것은 사용 방식이다. 전문 개발자도 같은 도구를 쓰면서 코드를 꼼꼼히 읽고 변경 사항을 살피고 테스트를 실행할 수 있다. 기계가 빨리 쓴다고 해서 책임이 저절로 사라지지는 않는다.[24] Karpathy 원글 미러
Manus와 OpenClaw는 대표적인 두 제품 방향을 보여준다. 한쪽은 여러 단계의 일을 서비스에 맡겨 완수하는 데 무게를 두고, 다른 쪽은 상주하는 도우미를 자신의 환경에 연결하는 데 무게를 둔다. 자율 실행의 가능성을 보여주면서 새로운 골칫거리도 드러낸다. 권한을 얼마나 줄 것인가? 실패는 어떻게 발견할 것인가? 이미 잘못한 조작은 어떻게 복구할 것인가? 이런 질문은 모델의 문제 풀이 능력만큼 중요하다.[25][26]
가속은 실제로 일어난다. 무엇이 빨라졌는지 분명히 해야 한다
인류가 지식을 남기고 전달하는 데는 기나긴 시간이 걸렸다. 전자 기계에 규칙을 맡기기까지는 수십 년이 걸렸다. 그런데 대중적인 대화 도우미에서 일상 도구를 실행하는 시스템으로 가는 데는 몇 년밖에 걸리지 않았다. 한 사람의 일생을 기준으로 보면 이 압축은 강렬하다. 예전에는 어른이 된 뒤 같은 일하는 방식으로 직장 생활을 마칠 수 있었다. 이제는 업무의 입구와 능력의 경계가 몇 년 안에 거듭 바뀔 수 있다.
이렇게는 말할 수 있다. 많은 인지 도구의 갱신 주기가 세대를 가로지르는 길이에서 한 세대 안으로, 다시 수십 년에서 몇 년으로 줄어들었다. 하지만 이 사실만으로 최근 몇 년의 “진보 총량”이 그전 수십 년을 넘었다거나, 그 수십 년이 인류의 생물학적 진화 전체를 넘었다고 단언할 수는 없다. 뒤의 비교에는 공통된 측정 단위가 없다. 석기, 문자, 농업, 산업혁명, 언어 모델도 단순히 더할 수 있는 점수들이 아니다.

선택한 이정표 사이의 간격. 1703—1936은 233년, 1936—1956은 20년, 1956—2012는 56년, 2012—2022는 10년, 2022—2025는 3년, 2025—2026은 1년이다. 막대 길이는 로그 척도이고, 숫자는 정수 연도 사이의 차이다. 선택에는 편향이 있고 간격이 계속 줄어드는 것도 아니므로, 이 그림으로 지능 성장률을 추론할 수 없다.
더 단단한 가속의 근거는 구체적인 지표에서 나온다. Stanford의 2025년 AI Index에 따르면, MMLU에서 GPT-3.5 수준의 성능을 내는 추론 비용은 2022년 11월 백만 token당 20달러에서 2024년 10월 0.07달러로 내려갔다. 280배 이상 낮아진 것이다. 특정 능력 기준에서 비용을 비교한 결과이지, 모든 모델이 같은 배수로 저렴해졌다는 뜻은 아니다.[28]
METR가 2025년에 발표한 연구는 “얼마나 긴 일을 할 수 있는가”에 더 가까운 변화를 관찰했다. 연구의 소프트웨어와 추론 과제 집합에서, 최첨단 AI가 50%의 성공률로 완수하는 과제에 대응하는 인간 전문가의 작업 시간이 2019년 이후 약 7개월마다 두 배가 되었다. 여기서 시간은 사람이 그 과제를 하는 데 필요한 시간이다. 절반의 성공 역시 신뢰할 만한 완수와는 다르다. 이 연구는 추세를 미래로 연장할 이유를 주면서도, 현실의 일에 널리 적용하는 데 큰 한계를 남긴다.[27]
가속은 스스로 다음 가속의 조건을 만들기도 한다. 더 나은 AI는 소프트웨어 작성, 실험, 시스템 최적화를 도울 수 있다. 그런 작업이 다시 다음 세대 AI를 개선할지도 모른다. 하지만 피드백이 있다고 해서 무한히 이어지는 것은 아니다. 데이터 품질, 에너지, 반도체, 실험 속도, 신뢰성, 조직의 도입이 제동장치가 될 수 있다. 역사의 침체기는 곡선이 한동안 올라갔다고 해서 이후에 단차나 후퇴가 없으리라는 보장은 없다고 알려준다.
나는 2031년에 건다. 먼저 AGI의 기준을 적어두자
AGI는 보통 범용 인공지능으로 옮긴다. 하지만 “어느 정도로 범용적이어야 하는가”에는 통일된 답이 없다. 대부분의 경제적 과제를 수행해야 한다는 사람도 있고, 낯선 기술을 배우는 능력을 강조하는 사람도 있으며, 자율성까지 포함하는 사람도 있다. AGI의 수준을 나누는 연구는 능력의 수준, 적용 범위, 자율성을 따로 논의한다. 구호를 놓고 다투는 것보다 도움이 되는 방식이다.[29]
이 글이 다루는 것은 실용적 AGI다. 권한이 명확한 디지털 환경에서 새로운 과제를 배우고, 받아들일 만한 비용으로 폭넓은 전문 인지 작업을 안정적으로 완수하는 시스템을 뜻한다. 의식이 있어야 할 필요는 없다. 사람의 몸을 가져야 하는 것도 아니고, 모든 분야에서 모든 사람을 뛰어넘는 초지능과 같은 것도 아니다.
이 예측을 나중에 검증할 수 있도록, 여기서는 인위적으로 정한 기준을 둔다. 이 글의 조작적 정의이며, 업계 표준도 안전 인증도 아니다.
| 평가 항목 | 이 글의 기준 |
|---|---|
| 적용 범위 | 소프트웨어 공학, 자료 분석, 연구 보조, 멀티모달 이해, 계획, 새 도구 학습이라는 6개 과제 범주 중 적어도 5개에서 숙련된 인간의 중위 수준에 도달한다. |
| 낯선 과제 | 각 범주에 적어도 100개 비공개 과제를 둔다. 학습 데이터 누출을 통제하고, 합리적인 도구 사용과 새 과제 학습을 허용한다. |
| 신뢰성 | 기준을 충족하는 각 분야에서 과제 성공률이 적어도 90%여야 한다. 결과는 사전에 정한 검토 가능한 기준으로 판정한다. |
| 긴 과제 | 인간 전문가가 완수하는 데 적어도 8시간이 필요한 과제를 포함한다. 각 과제에서 사람에게 확인을 요청하는 것은 최대 2회까지이며, 사람이 계속 구해줘서 되는 방식은 인정하지 않는다. |
| 비용 | 추론, 도구, 검토, 재작업을 모두 합산한 과제당 비용이, 같은 평가 기준으로 사람이 완수하는 비용보다 높지 않아야 한다. |
| 재현성 | 적어도 2개 독립 평가기관이 재현한다. 시스템은 90일간의 지속 평가에서 이 성능을 유지해야 한다. 멋진 시연 하나만으로는 부족하다. |

이 글의 AGI 기준 개념도. 6개 과제 중 적어도 5개, 100개 비공개 과제, 90% 성공률, 인간 기준 8시간의 긴 과제, 확인 요청 최대 2회, 90일간의 재현이다. 그림의 숫자는 인위적인 평가 조건이며, 현재 시스템의 실측 성적이나 공인된 AGI 표준이 아니다.
이 기준에도 논쟁의 여지는 있다. 과제를 어떻게 뽑을지, 숙련된 사람을 어떻게 모집할지, 연구 보조를 어떻게 평가할지는 미리 공개해야 한다. 사람의 안전에 관련된 과제에는 별도의 규제와 전문 기준도 필요하다. 이 기준의 쓰임은 “느낌상 이미 도달했다”는 말을, 의심하고 다시 측정하고 뒤집을 수 있는 판단으로 바꾸는 데 있다.
반드시 어느 해에 걸어야 한다면, 나는 2031년에 건다. 특정 월일을 맞히기보다 2028—2035년이라는 구간을 지켜보고 싶다. 아래는 이 글을 쓴 시점의 주관적 누적 확률이다. 앞서 정한 기준으로 처음 독립적인 확인을 받는 시기를 뜻한다. 통계 모델로 보정한 결과도, 전문가들의 합의도 아니다.
| 최초 확인 시점 | 나의 주관적 누적 확률 |
|---|---|
| 2028년 말까지 | 20% |
| 2031년 말까지 | 50% |
| 2035년 말까지 | 75% |
| 2035년 이후, 또는 현재 경로가 결국 이 글의 기준에 도달하지 못함 | 나머지 25% |
2031년은 이 주관적 분포의 중위 판단이지 기술의 기한이 아니다. 2035년까지의 75%에는 앞의 확률들이 이미 포함되어 있으므로, 표의 각 행을 더하면 안 된다. 나머지 25%도 AGI가 영원히 나타나지 않는다는 뜻은 아니다. 더 늦게 도착하는 경우와 현재 경로로는 도달할 수 없는 경우를 함께 담고 있다.
이렇게 거는 이유는 언어, 시각, 프로그래밍, 도구 사용이 합류하고 있고, 긴 과제의 수행 능력과 비용에서도 진지하게 볼 만한 추세가 나타나기 때문이다. 하지만 가장 어려운 부분은 마지막에 숨어 있을지도 모른다. 새 기술을 안정적으로 배우고, 자신의 오류를 알아채며, 낯선 환경에서도 신뢰성을 유지하고, 실험의 피드백이 필요한 일을 완수하는 문제다. 이것들이 예상보다 완강하다면 연도는 뒤로 옮겨야 한다.[27][28][29]
무엇이 나의 판단을 바꿀까? 사람의 개입이 적은 긴 과제의 성공률, 낯선 과제로의 전이, 총비용이 계속 개선되고 독립적으로 재현된다면 더 이른 도달 확률을 높이겠다. 순위표의 상승이 주로 익숙한 문제에서 나오거나, 긴 과제는 여전히 사람이 이어받아야 하거나, 비용 하락이 멈춘다면 확률을 낮추겠다. 발표회가 많아지고 시연이 촘촘해지는 것만으로는 판단을 바꾸기에 부족하다.
AGI의 도달에는 선명한 종소리가 없을 수도 있다. 어떤 사람은 업무에서 이미 충분히 쓸 만하다고 느끼고, 다른 사람은 계속 실패 사례에 시달릴 것이다. 평가기관이 능력을 확인한 뒤에도 사회는 천천히 바뀐다. 기술적으로 기준을 넘는 때, 제품이 채택되는 때, 제도가 조정을 마치는 때는 서로 다르다.
낙관적 미래: 사람의 능력이 지금만큼 희소하지 않게 된다

왼쪽은 지식 공유와 의료 발전, 가운데는 일자리 전환과 일상의 적응, 오른쪽은 권력 집중과 실업 압력을 나타낸다. AI로 제작한 독창적인 개념 삽화로, 조건에 따라 가능한 세 미래를 묘사하며 발생 확률을 표시하지 않는다.
낙관적 시나리오가 성립하려면 능력을 폭넓게 이용할 수 있어야 하고, 도입이 신뢰성을 유지해야 하며, 사회가 생산성의 이익을 더 많은 사람에게 나누려 해야 한다. 가장 좋은 시스템을 소수 기관만 감당할 수 있다면, 이야기는 처음부터 달라진다.
과학에서 AGI는 연구자가 문헌을 읽고 실험 후보를 설계하고 결과를 분석하도록 도와, 시행착오 속 반복 작업을 줄일 수 있다. 작은 팀이 과거의 큰 팀만 가졌던 계산과 분석 능력을 갖출지도 모른다. 약물, 소재, 에너지 연구가 빨라질 수 있다. 하지만 후보 분자는 검증해야 하고, 임상시험에는 여전히 시간이 필요하며, 실험 장비가 글에서 생겨나지도 않는다. 낙관적인 변화는 신뢰할 만한 결과를 찾는 속도를 높이는 것이지, 질병이 하룻밤에 사라진다는 약속이 아니다.
교육과 의료 서비스에서는 개인이 지속적이고 참을성 있는 도움을 더 저렴하게 얻을 수 있다. 교사는 학생 간 차이를 돌볼 시간이 늘고, 의사는 환자의 사정을 이해할 시간이 늘어난다. 외딴 지역이 먼저 얻는 것은 품질이 더 안정적인 정보 정리, 초기 선별, 원격 지원일 수 있다. 이를 공정한 개선으로 만들려면 접근 가능한 통신망, 현지 언어, 개인정보 보호, 최종 판단을 책임지는 사람이 있어야 한다.
일에도 여유가 생길 수 있다. 반복적인 문서 작성, 대조, 조정 작업이 줄고 사람은 소통, 판단, 돌봄, 창조에 시간을 쓴다. 작은 기업은 예전에는 전문팀을 고용할 여력이 없어 못 하던 일을 할 수 있다. 보통 사람도 아이디어를 제품으로 만들기 쉬워진다. 생산성이 높아진 결과가 낮은 생활비, 짧은 노동시간, 더 나은 공공서비스로 바뀐다면 다수의 삶은 나아진다.
이는 저절로 일어나지 않는다. 임금, 세제, 경쟁 정책, 공공투자가 이익의 배분을 결정한다. 더 나은 기술은 나눌 수 있는 몫을 늘릴 뿐, 사회 대신 나누는 방법을 결정하지 못한다. 이 시나리오에서 사람의 가치는 “표준화된 일을 얼마나 많이 할 수 있는가”에서 “무엇을 하고 싶은가, 어떤 책임을 맡으려 하는가, 다른 사람과 어떻게 살아갈 것인가”로 서서히 옮겨간다.
낙관은 사람이 배움을 멈춰도 된다는 뜻이 아니다. 기초 지식은 기계가 허튼말을 하는지 판단하게 하고, 전문 경험은 결과를 받아들일 가치가 있는지 알려준다. 달라지는 것은 학습의 목적이다. 모든 도구를 따라잡기 위해서만 배우는 것이 아니라, 더 나은 질문을 던지고 자신의 판단을 지키기 위해 배운다.
비관적 미래: 기계는 강하지만 사회가 받아내지 못한다
비관적 시나리오에는 기계의 악의가 필요하지 않다. 노동을 대체하는 속도가 이직과 전환 속도보다 빠르고, 이익이 계산 자원, 자본, 데이터, 유통의 입구를 가진 쪽에 집중되기만 해도, 많은 사람은 먼저 소득을 잃고 나중에 거시 통계 속 생산성 향상을 보게 될 수 있다.
먼저 압박받을 가능성이 큰 것은 업무를 디지털화하기 쉽고 결과를 평가하기 쉬운 일자리다. 여기서 직업 전체에 사망선고를 내려서는 안 된다. 하나의 직업은 서로 다른 많은 과제로 이루어져 있다. 그래도 초급 글쓰기, 기초 분석, 간단한 개발, 정형화된 고객 응대의 수요가 크게 줄면 청년들은 특히 까다로운 문제를 만난다. 경험을 쌓던 입문 업무는 사라졌는데, 더 높은 판단력에는 여전히 경험이 필요한 것이다. 기업이 신입을 덜 뽑으면 사회는 전문가를 키우는 사다리를 서서히 잃는다.
권력 집중은 이 압력을 키운다. 소수 조직이 최고의 모델, 계산 자원, 실행의 입구를 통제하면 가격만 정하는 것이 아니다. 누가 지식을 얻을 수 있는지, 어떻게 평가받는지, 무엇이 눈에 들어오는지에도 영향을 줄 수 있다. 지능이 더 저렴해지면서 감시, 사기, 표적 설득도 확대될 수 있다. 정보량은 늘어도 공론장에서 무엇이 진짜인지 확인하기는 더 어려워질 수 있다.
안전 위험에는 또 다른 층위가 있다. 능력이 강한 시스템도 목표가 잘못 설정되고 권한이 너무 넓고 검토가 빠지면, 잘못을 계속 실행할 수 있다. 메시지를 잘못 보내고 자료를 유출하고 결함 있는 소프트웨어를 만들며, 위험도가 높은 환경에서는 실제 피해를 낼 수도 있다. 더 극단적인 통제 상실 시나리오는 기만, 감독 회피, 자원 확보를 포함한다. 연구하고 대비해야 할 가능한 메커니즘이지만, 역사 연표만으로 믿을 만한 발생 확률을 제시할 수는 없다.
국가들 역시 첨단 AI를 뒤처져서는 안 되는 전략 자원으로 볼 수 있다. 경쟁 압력은 기관이 평가를 줄이고 실패를 감추거나, 시스템을 핵심 시설에 연결하도록 밀어붙인다. 그때 위험은 한 번의 오답에서 오는 것이 아니라, 많은 조직이 동시에 지나치게 큰 위험을 받아들이는 데서 온다. 무기, 사이버 공격, 핵심 시스템 도입에서는 특히 권한, 감사, 격리, 사람의 책임을 제도에 넣어야 한다.
개인 차원의 손실은 더 조용하다. 오래도록 기계에 판단을 맡기면 글쓰기, 추론, 길 찾기, 사교 능력이 약해질 수 있다. 편리함 속에서 사람은 조금씩 독립성을 잃는다. 서비스가 중단되거나 가격이 오르거나 답이 조작된 뒤에야, 대안이 없음을 알게 된다. 이런 미래에서는 기술이 강해져도 사람이 더 자유로워지는 것은 아니다.
중립적 미래: 거대한 변화와 긴 적응
내가 일상으로 더 쉽게 상상하는 것은 세 시나리오가 섞인 모습이다. 어떤 일은 빠르게 저렴해지고, 어떤 직업은 천천히 바뀌며, 일부 분야는 안전과 책임 때문에 계속 사람이 주도한다. 성공하는 회사도 있고, 실패하는 도입도 있다. 누군가는 시간을 얻고 누군가는 협상력을 잃는다.
AGI가 먼저 디지털 업무에서 이 글의 기준에 도달한다고 해서, 곧바로 수도관을 고치고 노인을 돌보고 전력망을 건설할 수 있는 것은 아니다. 실제 세계에는 몸, 재료, 장소, 책임의 사슬이 있다. 로봇 제조, 기반시설 갱신, 승인, 조직의 절차에는 별도의 시간이 필요하다. 인지 노동의 비용은 먼저 바뀔 수 있지만, 주거, 에너지, 의료 가격이 동시에 내려가리라는 보장은 없다.
고용의 결과는 먼저 과제 재편으로 나타날 가능성이 크다. 한 팀에서는 초안을 만드는 사람이 줄고 검수와 조정이 늘어난다. 한 사람은 더 많은 프로젝트를 관리하면서 잘못에 대한 책임도 더 많이 진다. 생산성과 노동 강도가 동시에 올라갈 수도 있다. ILO의 생성형 AI 직업 노출 연구도 과제가 영향을 받는 것이 곧 일자리 전체가 반드시 대체된다는 뜻은 아니라고 짚는다. 이 판단을 곧장 AGI의 고용 결과 예측으로 격상시킬 수는 없지만, 분석에서 지켜야 할 구분이다.[30]
제도는 현실을 쫓아가며 배운다. 학교는 평가를 바꾸고, 기업은 권한을 재배치하며, 법원과 규제기관은 책임을 다룬다. 보험과 감사는 가격을 매기기 시작한다. 많은 곳은 “기본적으로 실행할 수 있되, 중요한 지점에서는 사람이 서명한다”는 방식으로 넘어갈 것이다. 사회 전체의 한 번짜리 업그레이드라기보다, 다툼을 동반하는 일련의 수선에 가까울 것이다.
사람들의 심리 변화도 도구의 변화보다 늦을 것이다. 익숙하게 익힌 기술이 갑자기 희소성을 잃으면 아쉬움과 불안이 생긴다. 새 능력은 설레게 하지만, 끝없이 따라잡아야 하는 일에 지치게 할 수도 있다. 효율이 높아진다고 정체성이 저절로 자리를 찾지는 않는다. 돌봄, 우정, 몸의 경험, 미감, 공적 참여는 여전히 사람이 삶을 꾸리는 중요한 기준이 될 것이다.
그래서 2031년에 걸더라도, “그해부터 모두가 실업자가 된다”에 걸지는 않겠다. “그해부터 모두가 풍요로워진다”에도 걸지 않겠다. 기술적 돌파는 집중해서 일어날 수 있지만, 사회적 결과는 지역, 업종, 사람에 따라 다르게 펼쳐진다. 중립적 미래는 변화가 작은 미래가 아니다. 변화는 크고, 결과는 고르지 않으며, 조정은 느린 미래다.
진짜 준비해야 할 것은 판단과 선택이다
이 역사는 마음을 들뜨게 하면서 조금 어지럽게도 한다. 주판은 손가락으로 알을 움직일 때만 계산한다. 오늘의 기계는 모호한 부탁을 받아들여, 그것을 끝낼 방법을 찾기 시작한다. 우리는 더 많은 인지 작업을 머리 밖으로 옮기면서도, 어떻게 검수하고 책임지고 이익을 나눌지 아직 배우고 있다.
개인에게 지킬 만한 것은 전문적 기초, 확인하는 습관, 다른 곳에서도 쓸 수 있는 기술, 한 서비스에 의존하지 않는 일하는 방식이다. 기업이 투자할 만한 것은 검토 가능한 절차, 실제 과제 평가, 명확한 권한, 복구할 수 있는 조작이다. 사회에 가장 어려운 일은 생산성 증가가 소수의 우위로만 바뀌지 않게 하고, 안전 요구가 선언에만 머물지 않게 하는 것이다.
AGI의 연도에 건 예측은 틀릴 수 있다. 더 틀려서는 안 되는 것은, 기계가 충분히 똑똑해지면 인류가 저절로 좋은 미래를 얻는다는 믿음이다. 주판에서 오늘까지 도구는 계속 사람의 힘을 넓혀왔다. 다음에 답해야 할 것은 그 힘을 누가 쥐고 어떻게 쓰며, 우리는 그 힘으로 어떤 삶을 살고 싶은가이다.