KJM

강정민 KANG JUNG MIN — Seoul · KR / EN / 中文

아무도 안 보는 문제를 찾고, AI로 증명합니다.

문제를 찾는 사람 — AI는 실행 레이어입니다. 프로듀서에서 리서처로: AI 프로덕션, 평가 방법론, 배포된 제품을 넘나듭니다.

175M+
누적 조회수 — 숏폼 채널 운영
플랫폼 집계 기준 · 회사 소유 채널 9개 · 3,300+개 영상 가공·발행 · AI 미사용 — 별도 스택
최소 ρ 0.993
IRT 순위 안정성 — 150조건 합성 그리드(편향 결측)의 조건별 평균 최솟값
단독 저술 arXiv 프리프린트 2605.11205 · 단순 평균은 최악 조건에서 ρ = 0.24까지 붕괴
~1개월
100% AI 뮤직비디오 → 전국 방송
2인 유닛 · Warner Music Korea 유통망으로 발매 (회사 채널) · SBS 뉴스, 2025.03
왜 뽑아야 하는가 — 반론에 영수증으로 답합니다 ↓

01–03Cases — one grammar

케이스 3개, 문법 하나: Problem → Diagnosis → Execution → Result → Proof. 모든 숫자는 측정 방법을 달고 있습니다. 순서는 인과입니다 — 첫 케이스가 만든 질문에 두 번째 케이스가 답합니다.

CASE 01Origin — productionNuanced evaluation

100% AI 생성 뮤직비디오, 전국 뉴스에.

100% AI 생성 · 약 1개월 · SBS 전국 방송

(주)뉴텍 · 음악·엔터테인먼트, 파주 · Assistant Producer · 2023.05 – 2025.10 · 2025.03 공개

Problem
촬영 예산이 제한된 음악 회사에 뮤직비디오는 여전히 필요했습니다. 맡길 AI 팀은 없었고 — 이 문제를 풀 유닛은 아직 존재하지 않았습니다.
Diagnosis
기존 방식의 촬영은 비용과 일정 양쪽에서 무리였습니다. 진짜 질문은 "AI가 영상을 만들 수 있나"가 아니라 어떤 툴이 어떤 장면에서 살아남는가였습니다. 한 벤더에 걸지 않고 장면 단위로 생성 툴을 비교 검증했고, 5종이 통과해 각자 이기는 장면 유형에 배치됐습니다.
Execution
회사 최초의 AI 프로덕션 유닛(2인)을 제안하고 구축했습니다. Midjourney, Kling AI, MiniMax, Runway Gen-3 Alpha, Topaz 5종을 선정·통합하고 — 툴마다 입력 문법이 달라 — 크로스툴 영어 프롬프트 엔지니어링을 전담해 하나의 편집 파이프라인으로 연결했습니다.
Result
100%
AI 생성
모든 프레임
~1개월
기획 → 납품
2인 팀
SBS
전국 방송
뉴스 보도, 2025.03

Warner Music Korea 유통망을 통해 발매 — 회사의 기존 레이블 채널이지 개인 크레딧이 아닙니다. 제 몫은 파이프라인입니다.

Proof
AYOUNG — 'Waiting for the Sunshine' 100% AI 생성 뮤직비디오 스틸 프레임

AYOUNG — 'Waiting for the Sunshine' · 공식 YouTube 임베드, 클릭 시에만 로드

CASE 02Method — researchEnterprise-grade reliability

그 질문이 논문이 됐습니다: 평균은 언제 거짓말을 하는가?

150조건 합성 그리드, 편향 결측: IRT 조건별 평균 ρ ≥ 0.993(반올림) · 단순 평균은 ρ = 0.24까지 하락

Independent Researcher · 단독 저술 · arXiv:2605.11205 · 2026.05 – 현재

Problem
모든 리더보드가 점수를 평균 냅니다. 데이터가 희소하고 난이도 차이가 크면 그 평균은 순위를 조용히 뒤바꾸는데 — 업계는 그걸 정답으로 취급합니다. 프로덕션에서 계속 부딪히던 툴별 편차는 같은 실패의 한 층 아래 버전이었습니다.
Diagnosis
심리측정학은 인간 시험에서 이 문제를 수십 년 전에 풀었습니다. IRT를 LLM 평가에 적용한 선행연구는 존재합니다 — 제 기여는 체계적인 "언제, 왜"입니다: 4개 도메인(NLP·임상시험·자율주행 안전·사이버보안)에 맞춘 시뮬레이션과, 이와 별도로 희소도 × 난이도 격차를 훑는 150조건 합성 그리드로 평균이 무너지고 IRT가 버티는 지점을 지도화했습니다.
Execution
단독 저술, 무소속, GPU 없이 — IRT는 통계 모델이라 150조건 그리드 전체가 M1 Max 노트북에서 약 80초 만에 돕니다(NumPy/SciPy). arXiv endorsement는 교수 5명에게 보낸 콜드메일로 확보했고, 1명이 응답했습니다.
Result
완만한 조건 고희소 · 난이도 격차 → ρ 1.0 ρ 0.24 IRT — 조건별 평균 최소 ρ 0.993 단순 평균 — 최악 ρ = 0.24

헤드라인 결과의 도식 — 정확한 곡선과 150조건 전체는 논문에, arXiv:2605.11205

반응 역시 벤치마크 대비로 측정했습니다: 논문 공개 포스트의 LinkedIn 노출 5,184회 — 팔로워 1K 미만 계정 중앙값 225의 23배 (MagicPost, 56.6만 포스트 분석) — 첫 주 Threads 조회 17,000+. Playco 공동창업자 / Chief Product Officer Teddy Cross(Sequoia 투자, $1B 게이밍 유니콘)가 Discord에서 논문에 직접 반응했습니다 — 스크린샷으로 검증 가능합니다.

CASE 03Application — productShipping daily value

2주에 라이브 앱 7개. Day-30 리텐션 9.3%.

Day-1 37.0% · Day-30 9.3% · 앱 7개 / 2주

토스 미니앱 · 1인 · AI 에이전트 코딩 (Claude Code + Claude Design) · 2026.05

Problem
캐주얼 미니앱은 Day 30에도 사용자가 재방문하는지로 판가름 납니다. 1인 AI 빌드 앱 대부분은 토이 단계를 못 벗어납니다.
Diagnosis
마케팅 예산 0원이라 유저 획득은 잘못된 레버였습니다. 검증 가능한 레버는 리텐션 설계: 데일리 스트릭과 컬렉션 루프를 7개 앱 전부에 첫날부터 설계해 넣고, 공개 벤치마크와 대조해 측정했습니다.
Execution
실제 React/TypeScript 코드베이스 — 노코드가 아닙니다. AI 에이전트 코딩 파이프라인(Claude Code + Claude Design), 1인, 서버·광고·결제 없음. 토스 유기적 트래픽만.
Result
37.0%
Day-1 리텐션
마음동물 · Toss 분석
9.3%
Day-30 리텐션
마음동물 · 캐주얼 게임 평균의 약 2배
7개/2주
1인 출시
코드 타임스탬프 검증 가능

유저 수는 작습니다 — 플랫폼 내 유기적 유입만, 획득 비용 ₩0. 주장은 리텐션 설계이고, 의도적으로 그렇게 프레이밍했습니다.

Proof

04The hiring case

채용은 리스크 결정입니다. 이 페이지의 일은 면접을 건너뛰는 쪽이 더 위험하게 느껴지게 만드는 것. 그래서 채용 담당자가 마땅히 제기할 반론을 먼저 꺼내고 — 영수증으로 답합니다.

Enterprise-grade reliability

AX Talent War 2026 / Samil PwC — Trusted CEO Agent Challenge

₩30B 의사결정 시나리오를 위해 재판정 에이전트를 만들었습니다. 모든 계산과 판정은 결정론적 코드가 맡고, LLM은 입력 구조화와 결과 설명만 담당해 hallucination을 설계 단계에서 차단했습니다.

Finalist · 결정론 판정 · 사람이 읽을 수 있는 설명

"시켜야 움직이는 사람 아닌가?"
뉴텍의 AI 유닛은 제가 제안하기 전엔 없었습니다 — 누구도 이 문제를 배정하지 않았습니다. 이후 같은 패턴이 두 번 반복됐습니다: 프리프린트와 앱 7개 모두 스스로 정한 과제로 시작해, 완성해 공개했습니다.
영수증: SBS 방송 · arXiv:2605.11205 · 라이브 앱
"시작만 하고 못 끝내는 것 아닌가?"
14개월간 서로 다른 포맷 3종을 내놓았습니다: 전국 방송을 탄 뮤직비디오(~1개월, 2인 팀), 단독 저술 arXiv 프리프린트, 라이브 앱 7개(2주, 1인). 매체는 달라도 완주율은 같습니다.
속도 기록: ~1개월 · ~2주 · 독립 연구 → 공개 프리프린트 · 14개월 산정: 2025.03 → 2026.05
"학사 학위가 없다."
맞습니다 — 그러니 증거로 판단하십시오: 960시간 IBM × Red Hat AX 과정(LLM/RAG 워크플로우, watsonx, OpenShift, AWS EKS)과 콜드 아웃리치로 arXiv endorsement를 통과한 프리프린트. 전부 공개돼 있고 확인 가능합니다.
학력 기록은 아래에 · arXiv 저자 메타데이터 확인 가능
"숫자가 부풀려진 것 아닌가?"
이 페이지의 모든 수치는 측정 방법을 달고 있습니다 — "플랫폼 집계", "회사 채널", "최악 조건". 부정적 결과도 공개합니다: 암 데이터 연구는 순위 상관이 약하게 나온 자체 결과를 숨기지 않고 그대로 보고합니다.
사이트 전체 측정 캡션 · honest negative: reverse-IRT / GDSC2 저장소
"글로벌 팀에 맞나?"
한국어 네이티브 · 영어 유창(캐나다 온타리오 성장) · 중국어 회화. 에든버러 프린지 2023에 회사 최초 해외 대표로 파견 — 아티스트 통역과 현장 운영을 영어로, 단독 수행했습니다.
KR / EN / 中文 · 운영 기록은 아래에

이 답 중 귀사의 맥락에서 깨지는 게 있다면 — 그게 면접에서 제일 먼저 듣고 싶은 이야기입니다.

05Index — the ledger

나머지 전부, 한 줄씩. 위와 같은 규칙: 이름, 숫자 하나, 상태, 소스.

Research

EFSL — 평가 실패의 스케일링 법칙IRT 조건별 평균 최소 ρ 0.993 vs 평균 최악 0.24 (합성 그리드, 편향 결측)preprintarXiv
Isomorph-Eval공개 전 자체 variant 파이프라인에서 41% 오류율 적발open-sourcecode
AD-IRT — 적응형 차원ρ = 0.851, Evo-SOTA VLA 데이터 nested 5-fold CVopen-sourcecode
VLA 스코어링 결함 — Evo-SOTA.io, 183개 모델Physical AI 평가를 위한 IRT 기반 랭킹in preparationrepo
Reverse-IRT × 암 약물 반응 (GDSC2)측정값 242,036건 · 플랫폼 간 방향 일치 82% · 부정적 결과 정직 보고open-sourcecode
LLTM 평가학습 데이터 50%로 미평가 항목 ρ = 0.87open-sourcecode
PCR — 심리측정 콘텐츠 라우팅6.06 vs 3.67 / 10 (p = 0.004), GPU 비용 0open-sourcecode
PCR2 — 콜드스타트 확장ρ = 0.963 복원 · oracle 라우팅 품질의 96.9%open-sourcecode
FIRE — Fisher information 추천MovieLens-1M 카탈로그 커버리지 IRT 대비 1.8배, 명시적 점수 분해open-sourcecode
IRT × 글로벌 금융펀드 순위 최대 ±30계단 이동 · 50개 ETF, 217개월open-sourcecode
IRT × 사이버보안 (NVD)CVE 55,020건 · 중간 범위 벤더 우선순위 최대 2.3배 향상open-sourcecode

Build

My Celeb팬 수요 기반 1:1 영상통화 플랫폼 · 사전 출시 기능 17개livesite
월급 배터리수입 → 30일 방전 곡선 시뮬레이터, 모바일 우선livesite
SYNDI멀티모델 대립 토론 엔진 · 생성 콘셉트 94개local
NovelForge장편 소설 스튜디오 — 챕터 작업, QC, EPUB/PDF 내보내기local

Operations record

숏폼 채널 9개 (YouTube · Instagram)3,300+개 영상 가공·발행 · 플랫폼 집계 175M+ 조회 · 최고 릴스 19.2M · AI 미사용 — 별도 스택2023–2025
에든버러 프린지 페스티벌 2023회사 최초 해외 대표 · 통역 및 현장 운영2023

06About

제 작업은 프로덕션 현장의 실용적인 질문에서 시작했습니다: 왜 같은 입력이 툴, 모델, 벤치마크에 따라 다르게 작동하는가? 그 질문을 쫓다 프로듀서가 리서처가 됐습니다 — 하나의 측정 렌즈를, 같은 실패 패턴이 나타나는 곳마다 적용합니다.

AI를 실행 레이어로 씁니다: 파이프라인, 프리프린트, 프로토타입, 제품. 문제와 감각과 완주율은 저의 것입니다.

Education

IBM × Red Hat AX Academy960시간 집중 과정: LLM/RAG 워크플로우, watsonx, OpenShift, AWS (EKS)2025.08 – 2026.02
Metalworks Institute — 캐나다 미시소가Diploma, Electronic Music Production · Ontario PCC Act 2005 · IRCC DLI O110123589171디플로마

07Colophon — 이 사이트가 이렇게 생긴 이유

TypePretendard Variable — 한 패밀리가 한글과 영문을 커버해, 다국어 사이트가 한 목소리로 말합니다. 숫자는 JetBrains Mono — 측정된 수치는 계측기 출력물처럼 읽혀야 합니다.
Color종이, 잉크, 그리고 하나의 Fieldguide 그린. 정확한 #22B573은 선과 어두운 면에, 종이 위 텍스트에는 AA 대비를 확보한 #0F7547을 씁니다.
Captions모든 숫자가 측정 방법과 출처를 달고 있습니다. 단서는 숨기지 않고 그대로 표기합니다 — 제 연구 프로그램을 저 자신에게 적용한 것입니다.
Motion화면의 틀은 정지, 움직이는 건 작업뿐. 이 페이지의 유일한 애니메이션 그래픽은 논문의 결과 그 자체입니다. reduced-motion 설정을 존중합니다.
No 3D, no stock이 페이지의 모든 시각 요소는 작업 자체의 산출물입니다. 데이터 없는 장식은 테제와 모순됩니다.
Engineering수제 HTML/CSS/JS. 프레임워크·트래커·빌드 스텝 0 — 모든 주장이 서버 렌더 텍스트라 사람, 크롤러, AI 스크리너가 전부 읽을 수 있습니다. 폰트는 self-host.
Exhibit zero이 페이지 자체가 첫 번째 작업 샘플입니다: 문제(90초 안에 공정하게 평가받기), 진단, 실행, 그리고 지금 읽고 있는 결과.

08Contact

문제를 배정받기 전에 찾아내는 사람이 필요한 자리라면 — 메일 주세요. 빠르게 답합니다.