3줄 요약
- Thinking Machines Lab이 2026년 7월, 처음부터 자체 학습한 첫 오픈웨이트 모델 Inkling을 공개했다. 975B 총 파라미터에 41B 활성인 MoE 트랜스포머로, 최대 1M 토큰 컨텍스트를 지원하며 텍스트·이미지·오디오·비디오 45조 토큰으로 사전학습했다.
- 포지셔닝이 분명하다. 오늘 가장 강한 모델이라고 주장하지 않는 대신, 멀티모달 능력·조절 가능한 사고 노력(thinking effort)·Tinker 파인튜닝 지원을 묶어 “커스터마이즈하기 좋은 베이스 모델"을 내세운다.
- 12B 활성 파라미터의 Inkling-Small 프리뷰도 함께 공개했고, 전체 가중치는 Hugging Face에 올라와 있다. Tinker에서 한시적 50% 할인으로 파인튜닝할 수 있다.
어떤 모델인가
Inkling은 Thinking Machines Lab(이하 TML)이 처음부터 학습한 첫 모델이다. 스펙을 요약하면 이렇다.
| 항목 | Inkling | Inkling-Small (프리뷰) |
|---|---|---|
| 구조 | MoE 트랜스포머 | MoE 트랜스포머 |
| 총 파라미터 | 975B | 276B |
| 활성 파라미터 | 41B | 12B |
| 컨텍스트 | 최대 1M 토큰 | - |
| 사전학습 | 텍스트·이미지·오디오·비디오 45조 토큰 | 유사 레시피 (데이터·레시피 개선 반영) |
TML은 Inkling이 현존 최강 모델은 아니라고 스스로 밝힌다. 대신 여러 도메인에 두루 강하고 적응이 유연한 “넓고 균형 잡힌 파운데이션 모델"로 학습했으며, 멀티모달 능력·효율적 사고·Tinker 파인튜닝 가용성의 조합이 커스터마이즈용 오픈웨이트 베이스로서의 가치라고 설명한다. 발표 데모로는 Inkling이 Tinker 위에서 자기 자신의 파인튜닝 잡을 작성·실행·평가하는 장면을 보여줬다.
범용성과 에이전틱 코딩
Inkling은 에이전틱·추론·코딩·지시 이행·사실성·비전·오디오 태스크를 넓게 학습했다. 한 도메인의 벤치마크에 좁게 최적화하는 대신 폭을 택했는데, 서로 다른 워크플로우에 적응해야 하는 커스터마이즈 용도에는 폭이 더 중요하다는 판단이다.
에이전틱 코딩 쪽에서는 학습 단계부터 여러 코딩·에이전트 하네스 안에서 돌게 했고, 특정 도구 구성에 대한 민감도를 줄이기 위해 학습 중 도구 세트와 스키마를 무작위로 바꿨다. 공개 데모는 세 가지다.
- 웹앱 원샷 생성 후, 내장 브라우저 사용 에이전트가 자연어 지시로 그 웹앱 폼을 채우는 데모
- 정밀한 지시 이행과 일관된 스타일링을 갖춘 9페이지 PDF 아티팩트 생성
- GPT Codex를 리뷰어로 두고 40회 피드백 루프를 돌며 멀티플레이어 스네이크 게임을 다듬는 데모
블라인드 인간 평가로 웹앱을 비교하는 Design Arena의 Agentic Web Dev 리더보드에서는 오픈웨이트 모델 중 최상위권에 올랐다.
조절 가능한 사고 노력
Inkling의 차별점 하나는 effort 파라미터로 사고 노력을 0.2에서 0.99까지 조절할 수 있다는 점이다. TML은 단일 점수 대신 노력 대비 성능 곡선 전체를 공개했다.
Terminal Bench 2.1에서 Inkling은 Nemotron 3 Ultra와 같은 성능을 약 3분의 1의 토큰으로 달성한다.
비용과 지연은 모델을 수백만 번 돌리는 실사용 환경에서 구속 조건이 되고, 낮은 지연은 반복을 통한 협업·개선에 필수라는 논리다. 파인튜닝 개발자는 공개 벤치마크의 최대 성능만큼이나 효율을 중시한다는 자사 고객 관찰도 근거로 든다.
멀티모달: 인코더 없는 설계
Inkling은 TML이 앞서 공개한 인터랙션 모델 시스템의 백그라운드 추론 모델 역할을 염두에 두고 설계됐다. 음성·시각으로 실시간 협업하려면 네이티브 멀티모달 학습이 필요하다는 이유다.
구조가 흥미롭다. 오디오·비전 입력에 별도 인코더를 두지 않았다.
- 오디오: dMel 스펙트로그램으로 직접 입력
- 이미지: 40x40 픽셀 패치를 4층 hMLP로 인코딩
- 둘 다 경량 임베딩 레이어를 거쳐 텍스트 토큰과 함께 처리
오디오 벤치마크(VoiceBench 91.4%, MMAU 77.2%, Audio MC 56.6%)에서 오픈웨이트 최상위권이고, 비전에서는 차트·다이어그램·수학적 시각 추론에 강하다. 추론 중 파이썬 도구로 줌·크롭을 수행하며 시각 추론과 코드 추론을 결합할 수도 있다.
에피스테믹스: 보정·지시 이행·검열 저항
TML은 보정(calibration)·지시 이행·검열 저항을 묶어 모델의 에피스테믹스라 부르고, 이를 명시적 학습 목표로 삼았다.
보정 학습에는 실제로 결판난 현실 질문 코퍼스에 proper scoring rule을 보상으로 거는 RL을 썼다. 그 결과 ForecastBench Brier Index(검색 없음)에서 61.1을 기록해 GPT-5.5(59.1), Claude Opus 4.8(54.6)을 앞서고, Gemini 3.1 Pro(61.1)와 같고 Grok 4.3(61.7)에 근접했다.
지시 이행에는 자동 채점기 두 개를 함께 걸었다.
- 루브릭 채점기: 좋은 답이 담아야 할 체크리스트로 응답을 채점. 단독으로는 재현율에 치우치고, 그럴듯한 사실을 흩뿌려 루브릭 항목을 맞히는 해킹에 취약하다.
- 클레임 채점기: 응답의 사실 주장 하나하나를 에이전틱 웹 검색으로 검증해 틀린 주장에 페널티를 준다.
두 채점기를 함께 쓰면 유용성과 환각 감소를 맞바꾸지 않고 동시에 개선할 수 있었다고 한다. 여기에 기권 인지형 보상을 건 단답 QA 데이터셋을 더해, 확신이 있을 때만 답하고 아니면 “모른다” 또는 신중한 추측을 내놓는 정책을 학습시켰다. 검열 가능성이 있는 주제에 직접 답하도록 학습한 점도 명시했는데, Cognition의 Propaganda and Censorship Eval에서 강한 검열 불응 패턴을 보였다.
안전성
내부 안전 스펙에 맞춰 전 모달리티를 학습시킨 뒤 외부 테스터에게 검증을 맡겼다. 무기·폭력 관련 요청 거부와 무해한 유사 질문 통과를 함께 재는 FORTRESS에서 비교 대상 오픈웨이트 모델 중 가장 강한 내장 안전장치를 보였다(Adversarial 78.0%, Benign 95.9%). 명백한 유해 요청 거부를 재는 StrongREJECT는 98.6%로 다른 모델들과 비슷한 수준이다.
대표 벤치마크
전체 표에서 추린 주요 수치다. 모든 평가는 effort 0.99, temperature 1.0으로 돌렸다.
| 벤치마크 | Inkling | 오픈웨이트 비교 (최고치) | 클로즈드 비교 (최고치) |
|---|---|---|---|
| HLE (텍스트) | 29.7% | GLM 5.2 40.1% | Claude Fable 5 53.3% |
| AIME 2026 | 97.1% | GLM 5.2 99.2% | 99.9% |
| GPQA Diamond | 87.2% | Kimi K2.6 91.1% | 94.1% |
| SWEBench Verified | 77.6% | DeepSeek V4 Pro 80.6% | Claude Fable 5 95.0% |
| Terminal Bench 2.1 | 63.8% | GLM 5.2 82.7% | GPT 5.6 Sol 89.5% |
| IFBench | 79.8% | Nemotron 3 Ultra 81.4% | Gemini 3.1 Pro 77.1% |
| SimpleQA Verified | 43.9% | DeepSeek V4 Pro 57.0% | Gemini 3.1 Pro 77.3% |
숫자만 보면 개별 벤치마크 1위는 드물다. TML의 주장대로 이 모델의 상품성은 단일 점수보다 폭과 토큰 효율, 그리고 파인튜닝 접근성에 있다.
아키텍처: DeepSeek-V3 기반에 몇 가지 변주
MoE 설계는 대체로 DeepSeek-V3를 따른다. MoE 레이어당 라우팅 전문가 256개와 공유 전문가 2개, 토큰당 활성 라우팅 전문가 6개. 시그모이드 라우터에 보조 손실 없는 로드 밸런싱 바이어스를 쓴다.
어텐션 쪽 변주가 눈에 띈다.
- 슬라이딩 윈도우 레이어와 글로벌 레이어를 5:1로 교차 배치, KV 헤드 8개
- 위치 인코딩으로 널리 쓰이는 RoPE 대신 상대 위치 임베딩을 채택. 긴 시퀀스 외삽에서 더 낫다는 자체 결과
- 어텐션 레이어의 키·값 프로젝션 뒤, 그리고 어텐션·MLP 잔차 분기 출력에 짧은 컨볼루션을 적용
학습: Muon 하이브리드와 30M 롤아웃 RL
사전학습은 45조 토큰. 큰 행렬 가중치에는 Muon, 나머지 파라미터에는 Adam을 쓰는 하이브리드 최적화에, 자사의 modular manifolds 연구에서 끌어온 하이퍼파라미터 스케줄을 적용했다. weight decay 강도를 학습률의 제곱에 결합했더니 학습 기간 전반에 걸쳐 가중치 크기가 안정적으로 유지됐다고 한다. 학습은 NVIDIA GB300 NVL72 시스템에서 진행했다.
포스트트레이닝은 수학·에이전틱 코드·도구 사용·오디오·이미지·챗·안전 도메인에 걸쳐 이뤄졌다. 부트스트랩 단계에서 Kimi K2.5를 포함한 오픈웨이트 모델들이 생성한 합성 데이터로 초기 SFT를 돌렸고, 컴퓨트 대부분은 합성·인간 제작 환경에서의 대규모 RL에 투입했다.
RL은 3,000만(30M) 롤아웃 이상으로 확장했고, 두 번의 긴 연속 런에서 안정적 학습을 유지했다. AIME·HLE·GPQA 등을 묶은 홀드아웃 추론 평가 보상이 전 과정에 걸쳐 로그 선형으로 개선됐다.
RL이 만든 창발적 사고 압축
RL 과정에서 보상이 직접 겨냥하지 않은 변화가 하나 관찰됐다. 사고 사슬(chain of thought)이 갈수록 간결해지면서 문법적 군더더기를 떨어냈는데, 이해 가능성과 최종 응답 품질은 유지됐다.
“We need to understand"가 “We need determine"이 되는 식으로, 후기 RL의 사고 흔적은 관사와 연결어를 떨어내면서도 같은 답에 도달한다.
효율만으로 이 압축이 일어났다는 설명이다. Cognition 팀도 SWE-1.7 학습 과정에서 비슷한 현상을 보고한 바 있다.
Inkling-Small
함께 프리뷰로 공개한 Inkling-Small은 276B 총 파라미터에 12B 활성인 MoE 모델이다. 작은 모델용으로 사전학습 데이터와 레시피를 개선한 덕에 여러 벤치마크에서 형 모델과 대등하거나 앞선다. HLE with tools 46.6%(형은 46.0%), GPQA 88.3%(형은 87.2%), IFBench 83.4%(형은 79.8%). 반면 SimpleQA Verified는 20.9%로 형(43.9%)의 절반 이하라, 파라미터가 지식 저장에 미치는 영향이 그대로 드러난다.
12B 활성 파라미터와 조절 가능한 사고 노력의 조합은 코딩, LLM 채점기, 합성 데이터 생성처럼 비용·지연이 중요한 워크로드에 맞는다. 전체 가중치는 테스트 완료 후 공개 예정이다.
이용 경로
- Tinker에서 오늘부터 파인튜닝 가능. 컨텍스트 64K·256K 옵션, 한시적 50% 할인
- Tinker 콘솔의 Inkling Playground에서 채팅으로 모델 감각을 확인 가능 (에이전틱 웹 검색 통합, 한시 무료)
- 전체 가중치는 Hugging Face에 원본 체크포인트와 NVIDIA Blackwell용 NVFP4 체크포인트로 공개
- 서빙 파트너: TogetherAI, Fireworks, Modal, Databricks, Baseten. 오픈소스 추론은 SGLang, vLLM, llama.cpp, transformers 지원
- 오디오 능력을 다루는 쿡북 레시피 3종과 도구 호출·추론 콘텐츠·멀티모달 입력 샘플링용 tml-renderer 라이브러리 공개
가장 눈여겨본 것
이 발표에서 내가 곱씹은 대목은 “최강이 아님"을 스스로 명시한 포지셔닝이다. 프론티어 랩의 모델 발표는 대개 어떤 벤치마크에서든 1위 하나를 찾아 헤드라인에 걸기 마련인데, TML은 벤치마크 표에서 자기 모델이 밀리는 칸을 그대로 노출하면서 노력 대비 성능 곡선과 파인튜닝 접근성으로 승부를 옮겼다. 베이스 모델 선택이 “측정 가능한 벤치마크와 모델을 만져 봐야 아는 감각의 결합"이라는 서술은, 벤치마크 단일 점수 경쟁에 대한 우아한 우회로 읽힌다.
기술적으로는 에피스테믹스 절이 무게 중심이다. 루브릭 채점기의 해킹 취약성을 인정하고 클레임 채점기를 짝지어 유용성과 환각을 동시에 개선했다는 서술, 그리고 기권에 보상을 주는 QA 설계는 “보정된 불확실성"을 학습 목표로 끌어올린 드문 사례다. 예측 시장 벤치마크에서 프론티어 모델을 앞서는 오픈웨이트 모델이라는 지점은 파인튜닝 수요와도 직결된다.
출처
Thinking Machines Lab, “Inkling: Our open-weights model”, 2026년 7월 발표. 원문: https://thinkingmachines.ai/news/introducing-inkling/
원문의 차트·데모는 모두 인라인 SVG와 동영상이라 본문에 옮기지 못했다. 벤치마크 레이더 차트, 노력-성능 곡선, RL 스케일링 곡선과 에이전틱 데모 영상은 원문에서 직접 볼 수 있다.
