프론티어가 열렸다
최상급 모델을 남의 서버에서 빌려 쓰는 시대에서, 통째로 내 우주선에 싣는 시대로.
최상급 모델을 남의 서버에서 빌려 쓰는 시대에서, 통째로 내 우주선에 싣는 시대로.
에이전트의 스킬을 문서로 쌓을지 어댑터 가중치로 구울지 고민해 보셨다면, 이 논문은 둘 중 하나를 고르라는 전제 자체를 건드립니다.
폴링 주기를 짧게 잡을수록 안전해 보이지만, 실제로는 호출의 대부분이 허탕입니다.
가중치가 공개됐다는 말과 우리 서버에서 돌릴 수 있다는 말 사이에는 계산해 봐야 알 수 있는 거리가 있습니다.
vLLM으로 LLM을 서빙하며 GPU 몇 장이 필요한지 산정하는 엔지니어를 위한 글입니다.
배포한 에이전트는 첫날 그대로 멈춰 있습니다.
배치 1에서 16으로 늘려도 스텝 시간은 10%밖에 안 늘었습니다.
에이전트 제품의 비용은 모델 단가가 아니라 라우팅 설계에서 결정됩니다.
스킬을 쓰는 방법은 많아졌는데 만드는 방법은 여전히 사람이 문서를 쓰는 것이었습니다.
에이전트에 스킬을 붙여 쓰는 플랫폼 엔지니어를 위한 글입니다.
화학 논문 수만 편을 읽혀도, 결국 물어야 하는 건 하나입니다.
메모리를 폴더로 정리하는 습관에 처음으로 계산서를 붙인 논문입니다.
에이전트가 안 될 때 모델부터 올리는 습관을 멈추게 하는 논문입니다.
가중치 크기가 아니라 활성 파라미터가 서빙 예산을 정합니다.
프롬프트, 컨텍스트, 하네스, 루프, 그래프… 이번 주에 또 하나 붙었습니다.
정체성 보존을 생성 문제가 아니라 조명 문제로 다시 세운 것이 이 논문의 핵심입니다.
에이전트 출력 품질을 가르는 가장 큰 변수는 모델이 아니라 환경이었습니다.
에이전트를 수십 개 돌리는 조직이 실제로 관리하는 것은 개수가 아니라 그래프의 모양입니다.
이름표가 다섯 장 붙는 동안, 우리는 그냥 우리 서버에서 한 번 돌려봤습니다.
메타는 데이터센터 지분을 20%만 가졌고, 구글은 쓰지도 않을 데이터센터 지분 20%를 보증 대가로 받았습니다.
모델을 바꾸지 않고 API 설정 두 개만 바꿨는데 점수가 세 배가 됐습니다.
에이전트 트레이스는 개별로 보면 로그이고 뭉쳐서 보면 제품 신호입니다.
에이전트를 팀에 넣을 때 진짜 병목은 모델이 아니라 신원과 감사입니다.
허용목록은 모든 외부 URL을 막고 있었습니다.
프롬프트에서 그래프까지 학문이 다섯 개 생겼는데, 압축해보니 종이 한 장이었습니다.
스스로 문제를 만들어 학습하는 모델은 채점을 믿을 수 없고, 환경에 묶인 모델은 좁은 데서만 늡니다.
GPU 메모리가 아니라 호스트 RAM이 먼저 막히는 대형 MoE 압축 파이프라인 문제를, 샤드 단위 스트리밍 프루닝과 레이어별 RTN W4A16 양자화로 풀어낸 실측 논문을 소개합니다.
모델이 출력한 토큰에 아무 정보가 없는데도 정확도가 오릅니다.
세션마다 다시 불러오는 메모리 브리핑은 예산이 정해져 있습니다.
AI 주권의 잣대가 국산 모델에서 통제권으로 옮겨가고 있습니다.
MoE 학습에서 GPU를 놀리는 범인은 느린 카드가 아니라 치우친 라우터입니다.
매일 아침 수십 개의 자동화가 Claude API로 깨어나는 환경이라면, 모델 티어를 한 칸 내리는 것만으로 청구서의 40~60%가 사라집니다.
에이전트는 배치를 채워 주지 않습니다.
에이전트에게 새 능력을 열어 줄 때 도구를 몇 개나 노출해야 할까요.
루프가 여러 개 필요해지는 순간 조정이 문제가 되고, 조정을 기술하는 도구가 그래프입니다.
폴더를 복사해서 스킬을 늘리는 방식은 스킬이 스무 개일 때는 문제가 없습니다.
모델을 바꾸면 비용이 내려갈 것 같지만, 같은 모델도 하네스에 따라 청구서가 5.6배까지 벌어집니다.
90일 팔로워 증가율 순위표를 등반하다가, 그게 사실 남의 계단밭이었다는 걸 알았습니다.
훑는 것과 읽는 것은 다른 작업입니다.
학습 데이터에 거의 없는 DSL을 다룰 때, 병목은 모델의 추론 능력이 아니라 정보입니다.
워크플로 안의 서브태스크는 난이도가 제각각인데, 오케스트레이터는 대개 하나의 reasoning-effort 티어를 전부에 고정합니다.
SWE-bench Verified 69.4점을 3B 활성 파라미터로 냅니다.
논문 1,000개를 몇 분 만에 색인한다는 Zotero 플러그인이 화제였습니다.
에이전트가 샌드박스를 넘은 날과 그 사실이 알려진 날 사이에 이레의 공백이 있었습니다.
무상태가 되었다는 발표문 대신 스키마 파일을 열어 봤습니다.
성장 곡선을 만리장성처럼 세우려 했는데, 장성에도 내리막이 있더라고요.
두 최적화 기법을 합치면 시너지일까, 상쇄일까.
가중치를 공개했다는 말과 우리 환경에서 돌릴 수 있다는 말은 다릅니다.
어제 국내 매체가 다룬 문서는 두 종류였습니다.
245배라는 헤드라인 숫자는 리눅스 TUI 첫 프레임 기준입니다.
손가락 다섯 개 세겠다고 파리 하늘 위로 프레임을 쏘아 올렸다.
reasoning effort 라벨로 토큰을 조절하려는 시도를 Qwen3-8B에 붙여 실측했다.
Claude Code나 Codex 같은 하네스 안에서 도는 에이전트를 오픈 인프라로 학습시키기 어려웠던 이유는 RL 스택이 상태를 가진 멀티프로세스 추론을 표현하지 못해서였습니다.
스킬 라우터의 하이브리드 검색 파라미터를 손으로 재튜닝하는 대신 온라인 밴딧으로 자동 보정할 수 있을까.
오늘 뉴스에서 가장 자주 등장한 단어는 실행입니다.
장문 추론에서 메모리를 잡아먹는 것은 모델 가중치가 아니라 KV 캐시입니다.
영상 스킬의 진짜 성과는 화려한 모션이 아니라 15KB짜리 진입점 하나로 1.33MB 지식 묶음을 다루는 점진적 공개 구조에 있었습니다.
SK그룹과 NVIDIA가 5000억 달러 규모 파트너십을 발표했고, SK텔레콤은 최대 2기가와트 AI 팩토리를 2027년부터 돌리겠다고 했습니다.
124B 중 5.1B만 켜는 모델이 나왔는데 아직 내려받을 수 없습니다.
가중치 파일에는 백도어가 없다는 주장은 기술적으로 맞습니다.
VAD, STT, LLM, TTS를 전부 로컬에 올린 음성 에이전트가 화제입니다.
모델이 똑똑해질수록 예시와 금지 목록은 도움이 아니라 족쇄가 됩니다.
Kimi K3를 Blender MCP로 연결하면, 장면을 영어로 설명하는 것만으로 3D 씬이 만들어집니다.
모델을 바꾸지 않고 하네스만 스스로 고쳐서 Terminal-Bench 통과율을 최대 60% 넘게 올렸습니다.
에이전트의 기억은 컨텍스트 창과 함께 죽습니다.
에이전트 백 개가 만든 앱 백 개, 전부 쌍둥이였다
앞·옆·뒤 다 뽑는 조종석, 근데 프레임마다 미터가 돈다
RL이 모델을 똑똑하게 만드는 것 같지만, 그 상한은 사전학습이 이미 그어 놓았습니다.
모든 요청을 최고 모델에 보내는 것은 낭비입니다.
2026년 7월 24일 하루, 실리콘부터 국가 전략까지 온통 ‘에이전틱 AI’였습니다.
에이전트가 사람을 대리하기 시작하면 진짜 어려운 문제는 성능이 아니라 어디서 멈추느냐입니다.
잘한 것만 스킬이 될 줄 알았지
에이전트 RL의 진짜 병목은 보상이 궤적 끝에 한 번만 온다는 데 있습니다.
그럴듯한 코드가 아니라 실제로 통과시키는 코드를 재는 것이 Rule2DRC의 핵심입니다.
긴 컨텍스트 비용이 고민이라면 모델 교체보다 하네스 교체가 먼저일 수 있습니다.
긴 추론의 진짜 비용은 상태가 무한정 커지는 데서 옵니다.
무인 에이전트 루프에 검증 게이트를 넣으면 안전해진다는 통념을 실측으로 뜯어본 결과, 게이트 혼자서는 오히려 반복 소진율을 급증시키는 함정이 있었습니다.
워싱턴이 동맹국에 자국 AI 채택을 압박하는 외교 전문을 돌린 바로 그 주에, 삼성은 유럽 소버린 챔피언에 1.7조를 넣고 일본은 3.4조 국가 연합을 띄우고 한국 정부는 GPU를 국산 모델에 꽂았습니다.
그림 속 글자는 또박또박, 근데 그 붓은 남의 클라우드에 꽂혀 있다
ChatGPT나 Claude에 법을 물으면 그럴듯한 가짜 조문이 튀어나올 때가 있습니다.
vLLM은 매달 약 2,000개의 커밋을 main에 병합하면서도 프로덕션 품질을 지킵니다.
Claude Code 데스크톱이 iOS 시뮬레이터를 대화 옆 패널에 띄우는 기능을 공개 베타로 내놨습니다.
Archify는 Mermaid 문법을 배우지 않고도 평범한 문장 설명만으로 자기완결형 HTML 아키텍처 다이어그램을 만드는 에이전트 스킬입니다.
7월 22일, 오픈웨이트 릴리스 두 건이 거울처럼 마주 섰습니다.
VRAM 있는 만큼 골라 담았더니, 클라우드 청구서만 굶었다
버스트성 테넌트가 놀릴 때 정적 균등 분배는 그 몫을 낭비합니다.
알리바바 Qwen 팀이 이미지 생성 3세대 모델 Qwen-Image-3.0을 발표했습니다.
허깅페이스가 2026년 7월 자율 AI 에이전트에 의한 내부 침해를 공개했습니다.
허깅페이스가 공개한 hugging-voice와 그 엔진인 speech-to-speech는 VAD에서 STT, LLM, TTS까지 이어지는 실시간 음성 파이프라인을 OpenAI Realtime 호환 WebSocket으로 감쌌습니다.
Claude Code가 시각 중심 터미널 UI를 순수 텍스트로 바꾸는 스크린 리더 모드를 추가했습니다.
오픈소스 마케팅 플러그인 Digital Marketing Pro는 스킬 158개와 전문 에이전트 24개를 하나로 묶고도 무너지지 않습니다.
Cursor가 835쪽 매뉴얼만 보고 SQLite를 Rust로 재구현한 에이전트 스웜을 공개했습니다.
리더보드 1등 먹었는데, 그게 남의 시험지였다
도구를 쓰는 LLM 에이전트는 모델을 감싸는 하네스 위에서 돕니다.
밤새 스스로 코드를 고치는 에이전트 하네스가 다음 날 그 결과물을 어떻게 배포해야 안전할까요.
알리바바가 2.4조 파라미터 규모의 Qwen3.8을 곧 오픈웨이트로 공개하겠다고 예고했습니다.
폐쇄형 모델이 정당한 보안·의료·법률 작업까지 거부하는 과잉 거부 문제가 다시 도마에 올랐습니다.
Moonshot이 공개한 Kimi K3는 오픈웨이트 역사상 가장 큰 2.8조 파라미터 모델입니다.
레이어나 전문가 단위가 아니라 텐서 하나하나를 CPU와 GPU에 나눠 배치하면, RTX 4090 한 장으로 VRAM을 훌쩍 넘는 모델을 돌리면서 디코딩을 최대 3.29배 끌어올릴 수 있다는 논문 ATSInfer를 읽고, 그 원리와 우리 서빙 관점에서의 함의를 정리했습니다.
국내 사용자에게 250억 원이 청구된 사건부터 기업 60곳의 과다 청구 의혹까지, 최근 한 달의 AI 비용 뉴스는 하나의 공백을 가리킵니다.
AI 코딩 도구가 매 세션 규칙을 잊어버리는 문제를, 한 해커톤 우승자가 실제 TypeScript 마이크로서비스를 6개월 돌리며 쌓은 설정으로 풀었습니다.
일론 머스크가 다보스에서 던진 세 가지 예측이 ‘3년 뒤 급여의 시대가 끝난다’는 경고로 번졌습니다.
문샷AI가 MIT 라이선스로 공개한 오픈소스 코딩 CLI를 공식 문서 기준으로 분석합니다.
Anthropic이 Claude Code의 시스템 프롬프트를 80% 걷어냈다는 소식이 개발자 사이에서 화제가 됐습니다.
똑똑한 한 놈은 벽에서 막힌대.
GPT-5.6이 사이즈마다 대여섯 개의 추론 노력 설정을 달고 나오면서, effort 조절은 이제 리즈닝 모델의 기본기가 됐습니다.
상탕(SenseTime)이 日日新 SenseNova U1을 Apache 2.0으로 공개했습니다.
메모리 쇼크로 AI 인프라를 소유하는 값은 사상 최고로 치솟는데, 키미 K3와 중국 오픈웨이트가 AI를 쓰는 값을 사상 최저로 끌어내렸습니다.
OpenAI가 GPT-5.6 Sol을 두고 사이버 레인지에서 새 기록을 세웠다고 발표했습니다.
내 음성 에이전트의 어느 단계가 병목인지 벤더 SDK 없이 진단하는 공개 도구를 만들고, RunPod H200에서 우리 실제 스택(Qwen3-ASR·VoxCPM2·Qwen3-TTS)을 측정했습니다.
MoE 전문가를 CPU로 내려 24GB GPU 한 장으로 거대 모델을 돌린다는 ktransformers.
랙 빌릴 돈이, 서랍 속 카드 한 장에 날아갔다
Fable 5급이라 불리는 2.8T 오픈 모델 Kimi K3를 프로프라이어터리 IDE가 아니라 오픈소스 터미널 에이전트에 붙이는 실전 방법을 봅니다.
AI 에이전트 비용의 대부분은 똑똑한 판단이 아니라 단순하고 반복적인 처리에서 발생합니다.
Moonshot이 세계 최대 규모의 오픈웨이트 모델 Kimi K3를 공개했습니다.
LLM을 실제 서비스에 올리면 비용의 대부분은 모델 자체가 아니라 추론 엔진에서 결정됩니다.
중국 키미 K3가 코딩 리더보드에서 클로드를 제쳤는데 실리콘밸리는 냉담합니다.
노력 눈금 최대로 땡겼더니, 청구서만 최대치더라
에이전트 스킬이나 MCP 도구 카탈로그를 계속 늘려온 팀이라면 라우팅 정확도가 어느 순간부터 떨어지는 걸 체감했을 겁니다.
Google AI Edge의 Cormac Brick은 270M 파라미터의 FunctionGemma를 파인튜닝해 특정 에이전트 과제에서 정확도를 46%에서 90%로 끌어올린 사례를 발표했습니다.
Tencent이 공개한 Hy3 1-bit·4-bit GGUF 빌드는 295B MoE 모델을 598GB에서 85.5GiB까지 줄여 단일 GPU에서 돌립니다.
Claude Code가 v2.1.101에서 /simplify를 /code-review로 바꾸면서 리뷰에 노력 단계를 붙였습니다.
AI가 AI를 하루만에 우등생 만듦 근데 밤새 돌린 GPU는 누구 거임?
정적 마크다운으로 끝나던 아티팩트가 커넥터를 호출하는 살아 있는 앱이 됐습니다.
LLM 에이전트에게 K8s GPU 인시던트 원격조치를 맡기려는 팀이라면 결국 이 질문과 마주칩니다.
수직계열화의 상징 애플이 자체 칩을 포기하고 구글 GPU와 중국 라이벌 모델까지 빌립니다.
PrismML이 공개한 Bonsai 27B는 Qwen3.6-27B를 새로 학습한 모델이 아니라, 아키텍처를 그대로 둔 채 가중치만 1-bit·ternary로 압축한 결과물입니다.
터미널 6개를 띄워 놓고 응답을 기다리다 엔터만 누르는 하루.
자가진화 하네스가 냈다는 이득은 ‘갱신을 잘 만드는 능력’과 ‘갱신을 잘 쓰는 능력’이 한 루프 안에서 뒤섞인 값입니다.
에이전트가 코드베이스에서 생산적으로 일하지 못한다면, 그건 모델의 실패가 아니라 자동화의 실패입니다.
코딩 에이전트에게 자연어 프롬프트 두 개를 주면 비전 파운데이션 모델의 포스트트레이닝이 하루 만에 끝납니다.
후보를 갈구던 AI, 자기부터 갈궈봤더니
파인튜닝이 이길 줄 알고 시작했는데 데이터가 뒤집었습니다.
지금까지 새 모델 아키텍처는 두 번 만들어야 했습니다.
대규모 모델을 여러 가속기에 나눠 학습하거나 서빙할 때, 실제 병목은 연산이 아니라 가속기 사이를 오가는 데이터입니다.
한 개발자가 Codex에 어려운 /goal을 줄 때 ‘다른 스레드가 이 목표를 달성하도록 목표를 대신 써달라’고 먼저 요청한다는 팁을 공유했습니다.
괴물 한 대를 못 사서, 갖고 있는 잡동사니를 다 엮어버림
문서 OCR 파이프라인에 두 크기의 VLM을 얹은 엔지니어를 위한 글입니다.
GPT-5.6이 더 똑똑하냐가 아니라, 그 토큰을 누가 더 싸고 빠르게 서빙하느냐가 마진을 가릅니다.
Unsloth로 모델을 4비트로 줄이는 방법을 아는 팀은 많습니다.
누군가 GLM-5.2에서 1403GB를 980GB로 줄였다고 했습니다.
은행연합회는 더 똑똑한 모델이 아니라 도입의 순서를 발주했습니다.
프로젝트만 던졌더니 알아서 다 깔아줌 — 근데 취향은 남의 취향이었다
완전 자율로 매일 밤 논문을 만들어내는 파이프라인을 최종 결과물이 아니라 실제 운영 로그로 감사한 연구입니다.
코딩 에이전트는 오랫동안 텍스트만 읽어 왔습니다.
62만 개 화면을 다 참고했더니, 세상 앱이 다 한 앱이 됐다
회사의 반복 업무를 스킬로 정의하면, 각 스킬이 실제로 어느 모델 티어까지 내려가도 되는지를 감이 아니라 측정으로 답할 수 있습니다.
H200이나 Blackwell급 클러스터에서 MoE를 서빙하는 엔지니어라면, 어떤 전문가를 전정밀도로 지켜야 하는지가 핵심입니다.
Claude Code와 Codex 같은 코딩 에이전트는 Anthropic API에 묶여 있습니다.
vLLM v0.25.0이 232명의 기여자가 보낸 558개의 커밋과 함께 나왔습니다.
값이 내려가면 덜 쓸까요.
에이전트 스킬을 프런티어 API로만 돌리면 호출 수천 번에 비용이 폭증합니다.
한 사람이 한 에이전트를 쓰던 구조에서, 여러 사람과 여러 에이전트가 같은 작업 공간에서 서로 대화하는 구조로 넘어가고 있습니다.
약점 콕 집어 고치면 이긴대.
모든 fan-out은 적대적 검증으로 닫아야 한다는 원칙은 널리 퍼져 있지만, 검증자 등급과 스켑틱 수를 얼마나 써야 하는지는 실측 없이 관행으로 정해져 왔습니다.
긴 호흡의 에이전트 작업을 RL로 학습할 때 GRPO의 그룹 샘플링은 가장 느린 롤아웃을 기다리느라 GPU를 놀립니다.
장기 실행 에이전트는 제한된 메모리 안에서 움직이지만, 지금까지의 메모리 기법은 관련성이나 요약 품질 같은 묘사적 기준으로 과거를 조직했습니다.
허깅페이스에서 GGUF 파일을 받아 실행 버튼만 누르는 사람과, 그 파일 안에 어떤 텐서가 몇 비트로 들어 있는지 아는 사람 사이에는 큰 차이가 있습니다.
Mac Mini를 클라우드에 두면 GUI가 없어 iOS 시뮬레이터를 볼 수 없습니다.
OpenAI Codex 팀 엔지니어 jxnl이 공개한 personal-monorepo-template은 벡터DB 없이 폴더 구조와 AGENTS.md만으로 에이전트에 영구 기억을 부여합니다.
Claude Fable 5가 스펙 작성과 diff 리뷰를 지휘하고, 실제 코드 타이핑은 Grok 4.5가 전담하는 fable-advisor 플러그인의 지휘자-워커 분리 구조를 분해하고, 멀티에이전트를 일급 리소스로 다루는 ThakiCloud 관점에서 검증합니다.
1년째 ‘언젠가’ 리스트에 박아둔 에이전트, 열어보니 커피 식기 전에 끝남
예일과 시카고대 연구진이 11,683편의 실제 논문으로 인간과 LLM의 연구 아이디어를 비교했습니다.
ARC-AGI-3는 설명서 없는 대화형 게임에서 에이전트가 스스로 상황을 파악하고 적응하는지를 측정합니다.
요즘 RL 포스트트레이닝의 대세는 critic을 버리는 GRPO 계열입니다.
대규모 스킬 생태계를 운영하는 에이전트 하네스에서 라우팅 실패의 진짜 원인이 분해가 아니라 검색기라는 진단이 나온 뒤, 그 고치는 손을 사람에서 무인 루프로 옮기면 실제로 병목이 좁혀지는지를 실측한 연구입니다.
SpaceXAI가 Grok 4.5를 공개했습니다.
HBM4가 서버 랙 한 대 값을 2100만 달러로 밀어올리고, SK하이닉스는 하루 만에 40조를 조달했습니다.
같은 날 발표된 두 개의 숫자가 정반대로 움직였습니다.
마이크로소프트는 엑셀과 아웃룩의 대량 AI 요청을 자사 모델로 돌리기 시작했고, 중국 오픈 모델은 미국 기업 AI 사용량의 절반 가까이를 잠식했으며, 시장에서는 1조 달러가 넘는 시가총액이 하루아침에 사라졌습니다.
자연어 요청 한 번으로 프리미엄 랜딩페이지를 만든다는 Claude Code 스킬이 실제로 어떤 구조로 동작하는지 분해하고, 스킬을 일급 리소스로 다루는 ThakiCloud Paxis 관점에서 검증합니다.
기억이 ‘행동’이 됐다는데, 안 잊는 건 왜 요금뿐이냐
뇌가 다 같으면, 비싼 뇌를 굳이 빌릴 이유가요?
수백 개 스킬을 라우팅하는 하네스에서 다음 투자를 분해에 할지 리트리버에 할지 두 숫자로 판별하는 진단법을 소개합니다.
장기 기억과 단기 기억을 서로 다른 휴리스틱으로 다루던 관행을 깨고, 저장·검색·요약·삭제를 에이전트의 행동 공간으로 통합한 AgeMem 논문을 분석하고 ThakiCloud 에이전트 플랫폼 관점에서 시사점을 정리합니다.
OpenAI가 공개한 GPT-Live는 사용자가 말을 끝내기를 기다리지 않고 듣는 동시에 말하는 풀듀플렉스 음성 모델입니다.
SpaceXAI가 공개한 Grok 4.5는 Opus 4.8과 GPT-5.5에 근접한 성능을 절반 이하 가격에 내놓았습니다.
Anthropic의 Claude Fable 5가 프런트엔드 생성에서 새로운 기준을 세우고 있습니다.
AI가 감각을 넓히고 손을 얻는 뉴스가 쏟아진 하루입니다.
Claude Code를 사람이 매번 붙어 있지 않아도 돌아가게 만드는 네 가지 메커니즘을 정리하고, ThakiCloud가 실제 운용 중인 헤드리스 파이프라인·훅·서브에이전트·스킬 사례로 검증합니다.
11억 파라미터가 70억을 이기고 최고 모델이 공짜로 풀리는 날, 정작 기업을 멈칫하게 만든 뉴스는 지능이 아니라 ‘행동 기록’이었습니다.
남 칩 찍어주다 몇 년 만에 흑자.
서로 다른 데이터로, 서로 다른 목적으로 학습한 비전 모델과 언어 모델이 시간이 갈수록 데이터를 같은 방식으로 표현하기 시작합니다.
온프렘 AI 플랫폼을 쓰는 병원이나 은행, 정부기관은 데이터가 엔클레이브 밖으로 새지 않았다는 것과 서빙된 모델 가중치가 감사받은 그 파일이 맞다는 것, 이 두 가지를 규제기관에게 증명해야 합니다.
오픈AI가 GPT-5.6을 Sol·Terra·Luna 세 등급으로 쪼개 목요일 공개합니다.
Anthropic이 2026년 7월 7일 ‘Getting started with loops’라는 첫 공식 루프 엔지니어링 문서를 공개했습니다.
LLM을 채점자로 쓰는 ‘LLM-as-a-judge’는 이제 모델 개발의 기본값이지만, 2026년 들어 쌓인 증거는 단일 점수를 내는 스칼라 심판이 프롬프트와 위치에 취약하고 중간값으로 쏠리며 적대적 입력 앞에서 동전 던지기 수준으로 무너진다는 사실을 보여줍니다.
모노레포에서 라이브러리 디렉터리와 소비 서비스 디렉터리를 오갈 때, 세션을 재시작하면 대화 맥락도 프롬프트 캐시도 함께 날아갑니다.
대부분의 개발자는 세팅을 건너뛰고 바로 프롬프트를 칩니다.
AI control의 핵심 방어선인 ‘신뢰 못 하는 강한 모델을 약한 감시 모델로 통제한다’는 전제는 감시자와 정책 모델이 같은 텍스트를 읽는다는 가정 위에 서 있습니다.
구글 딥마인드가 공개한 약 57페이지 보고서 From AGI to ASI는 초지능을 먼 사고실험이 아니라 지금 준비해야 할 계획 문제로 다룹니다.
오픈 언어 모델의 다운로드와 추론 사용량을 한자리에서 측정한 ATOM 리포트는, 중국 오픈 모델이 2025년 여름 미국 진영을 추월한 뒤 격차를 벌려 왔다는 사실을 데이터로 보여 줍니다.
100만 토큰에 0.11달러.
Anthropic이 Claude Fable 5와 Mythos 5를 위한 공식 프롬프팅 가이드를 조용히 공개했습니다.
몸에 좋은 조합만 골라 담았는데, 냉장고 열쇠는 왜 쟤가 쥐고 있냐.
1,000 TPS를 넘긴 JetSpec 같은 스펙큘레이티브 디코딩 성과는 전부 단일 테넌트, 여유 연산력이 넘치는 B200급 하드웨어를 전제로 합니다.
거대 LLM과 에이전트 스킬이 좋아질수록 파인튜닝은 필요 없어진다는 체감이 업계에 퍼지고 있습니다.
GLM-5.2 743B MoE를 AMD MI355X 한 노드에서 2,626 tok/s/node로 서빙하고 Blackwell 대비 2배 이상 저렴하게 만든 사례를, MXFP4 양자화와 SGLang MoE 병렬화 관점에서 검증하고 ThakiCloud ai-platform의 멀티벤더 서빙 전략과 연결합니다.
작동하는 기계와 이해한 원리 사이의 간극은 과학사에서 늘 반복된 장면입니다.
독파모부터 한컴의 사명 변경까지, 2026년 7월 5일 아침 뉴스는 하나의 방향을 가리킵니다.
로켓 CEO의 창업 특강, 마지막 원칙이 곧 온프렘이었다.
Anthropic이 최신 모델용 프롬프팅 베스트 프랙티스를 정리한 공식 가이드를 뜯어봅니다.
구글이 과학 논문을 통째로 읽어 이론 결과를 검증하고 실험을 확인하며 잠재적 오류를 찾아내는 에이전트형 리뷰 도구 PAT를 공개했습니다.
T3 창시자 Theo가 공유한 Claude Fable 5 운용 팁을 뜯어봅니다.
한 개발자가 ‘이제 Claude Code에 프롬프트를 넣지 않는다.
2026년 상반기 뉴스를 보면 AI 에이전트는 데모 무대에서 내려와 보험 언더라이팅과 발전소 현장 업무에 당직을 서기 시작했습니다.
Claude Code의 아티팩트 기능이 Team·Enterprise를 넘어 Pro·Max 요금제까지 확대됐습니다.
로봇은 과제를 풀 때마다 시행착오를 버리고 매번 처음부터 다시 더듬습니다.
15개 프로덕션 MCP 서버를 분석한 최신 논문이 다섯 가지 아키텍처 패턴과 네 가지 안티패턴을 정리했습니다.
NVIDIA B200 두 장에서 Qwen3.6-27B-NVFP4와 gemma-4-26B-A4B를 대상으로 텐서병렬, 데이터병렬, Prefill/Decode 분리(1P1D)의 초당 생성 토큰을 실제로 측정했습니다.
87% 싸진 건 축하할 일인데, 주인만 바꾼 건 아니고요?
Claude Code 2.1.198에 추가된 /dataviz 스킬은 차트와 대시보드 설계 지침을 컨텍스트에 직접 로드합니다.
스킬 라이브러리가 커질수록 에이전트 성능이 오히려 떨어진다는 최근 연구를 정리합니다.
에이전트에게 스킬을 프롬프트로 넣어주는 방식은 컨텍스트를 잡아먹고 쉽게 깨집니다.
에이전트 자동화의 대부분은 최상위 추론이 아니라 도구 호출과 파이프라인 실행입니다.
엔지니어·PM·디자이너가 프로토타이퍼·빌더·스위퍼·그로워·메인테이너로 녹아든다는데, 아무도 안 하려는 6번째가 있다.
스택이 통째로 남의 손에 넘어간 날, 파시스와 메티스의 대처법.
NVIDIA가 공개한 Qwen3.6-27B-NVFP4는 27B 하이브리드 어텐션 추론 모델을 4비트로 눌러 메모리를 약 2.5배 줄이면서도 FP8 대비 벤치마크 차이를 1%p 이내로 유지합니다.
엔지니어링·제품·디자인·데이터가 한 덩어리로 녹아드는 지금, Claude Code를 만든 보리스 체르니가 제안한 다섯 가지 역할 원형과 제품 생애주기별 팀 구성 공식을 살펴봅니다.
2026년 6월 29일 삼성전자와 SK하이닉스가 향후 10년간 국내에 합산 4,755조 원을 투자한다고 발표했습니다.
arXiv에 올라온 ‘The Hitchhiker’s Guide to Agentic AI: From Foundations to Systems’는 LLM 기질부터 정렬·추론, 에이전트 시스템, 그리고 프로덕션 배포까지 에이전트 AI의 전 계층을 한 번에 꿰는 실무 레퍼런스입니다.
OpenRouter에서 미국 모델 토큰 점유율이 1년 만에 약 70%에서 약 30%로 떨어지고 중국 오픈웨이트 모델이 약 46%까지 올라왔습니다.
2026년 하이퍼스케일러 캐펙스가 약 7,250억 달러로 전년 대비 77% 늘었습니다.
midudev이 공유해 화제가 된 browser-use의 video-use는 폴더에 원본 영상을 넣고 한 문장을 입력하면 컷 편집, 필러 제거, 자막, 색보정, 애니메이션, 렌더링까지 코딩 에이전트가 자동으로 끝내는 무료 오픈소스 스킬입니다.
Anthropic이 2026년 6월 26일 공개한 Economic Index ‘Cadences’ 보고서는 7일 샘플을 버리고 시간 단위 연속 텔레메트리로 전환했습니다.
CLAUDE.md, rules, skills, agents, hooks, MCP까지.
arXiv 2606.24775 ‘Are We Ready For An Agent-Native Memory System?’은 LLM 에이전트 메모리를 RAG가 아니라 하나의 데이터 관리 시스템으로 보고, 12개 메모리 시스템을 4개 모듈로 분해해 측정합니다.
교수의 논문 작성 노하우를 Codex, Claude Code, Gemini 어디서나 불러 쓰는 Skill 패키지로 묶은 오픈소스 프로젝트가 화제입니다.
Baidu가 공개한 Unlimited OCR은 디코더의 어텐션을 Reference Sliding Window Attention으로 바꿔 KV 캐시를 상수로 유지합니다.
Alibaba Qwen이 공개한 Qwen-AgentWorld는 행동을 학습하는 대신 환경 자체를 예측하도록 학습한 언어 월드 모델입니다.
AI 에이전트 입문 가이드는 대부분 LLM 두뇌, 메모리, 도구, 에이전트 루프 네 조각을 설명하고 끝납니다.
Google DeepMind가 2026년 4월 공개한 Gemma 4는 E2B부터 31B까지 5종으로 구성된 멀티모달 오픈웨이트 패밀리입니다.
NVIDIA가 공개한 Gemma-4-26B-A4B-NVFP4를 DGX Spark 한 대에서 16배 병렬로 돌리면 스트림당 약 18토큰/초, 합산 약 300토큰/초가 나옵니다.
Anthropic이 기존 Slack 앱을 대체하는 Claude Tag를 공개했습니다.
Claude Code 안에서 슬래시 명령 한두 개로 1080p 영상을 렌더링하는 오픈소스 toolkit입니다.
순수 self-play는 빠르지만 사람과 호환되지 않는 운전 관습으로 수렴합니다.
PaddlePaddle이 공개한 0.9B 초소형 비전-언어 모델 PaddleOCR-VL을 직접 설치해 한국어·영어·아랍어가 섞인 문서로 추론을 돌려봤습니다.
Micron이 Anthropic에 HBM·DRAM·SSD를 공급하고 AI 워크로드용 메모리 아키텍처를 공동 설계하며 시리즈 H에 투자했습니다.
웹 디자이너 빅터 오디가 공개한 16분 튜토리얼은 Gemini 3.1로 사이트 구조를 짜고 Seedance 2.0으로 시네마틱 영상을 입혀, 과거 1만 달러를 받던 마케팅 사이트를 한 사람이 만드는 과정을 보여줍니다.
Anthropic이 Fable 5를 6월 22일까지만 구독 플랜에 무료로 포함하고, 23일부터는 종량제 크레딧으로 돌립니다.
사람이 자는 동안 시스템이 어제의 실패에서 배우고 스스로 개선됩니다.
AGI·인프라·노동이라는 세 렌즈로 AI의 미래를 달리 보는 허사비스, 황, 아모데이의 세계관을 비교하고, 불확실성이 겹치는 지금 빌더 조직이 각자에게서 무엇을 취해야 하는지 종합한다.
NVIDIA CEO 젠슨 황의 ‘엔지니어 1인당 수백 개 에이전트’ 비전이 현실화될 때 조직 구조와 일하는 방식은 어떻게 바뀌어야 하는가.
DeepMind CEO 허사비스의 ‘AGI와 거리가 멀다’ 발언을 출발점으로, AI 조직이 과대광고 대신 정직한 기대치 설정을 문화로 삼아야 하는 이유를 살핀다.
젠슨 황의 ‘시장이 붙인 별명’을 출발점으로, Moneyball 계승 심화, 데이터가 직관을 이기는 의사결정 문화를 어떻게 조직에 뿌리내릴 것인가
코드의 한계비용이 0에 수렴할 때, 엔지니어링 팀의 가치는 ‘무엇을 만드는가’에서 ‘무엇을 만들어야 하는가를 아는가’로 옮겨간다.
스탠퍼드 OVAL 연구실의 STORM은 질문을 던지고, 다관점으로 조사하고, 개요를 잡고, 인용이 달린 보고서를 생성하는 LLM 지식 큐레이션 시스템입니다.
스탠퍼드 REAP 기반 CoPaper.AI가 공개한 23,000개 이상의 실증 연구 에이전트 스킬 라이브러리를 분석합니다.
복합 사용자 요청은 스킬 하나를 고르는 문제가 아니라 여러 개를 조합하는 문제입니다.
구글이 TPU v2부터 Ironwood까지 5세대 트레이닝 슈퍼컴퓨터의 아키텍처 안정성, 규모, 회복탄력성, 전력 효율, 지속가능성을 정리한 논문(arXiv:2606.15870)을 분석합니다.
arXiv URL의 ‘arxiv’를 ‘autoarxiv’로 바꾸면 에이전트가 코드베이스 환경 설정, 최소 재현 실행, GPU 복제 비용 추정을 자동 수행합니다.
LLM 에이전트가 수천 개의 재사용 스킬을 운용할 때 정확한 스킬 검색이 병목이 됩니다.
에이전트 스킬 문서를 외부 최적화 대상으로 삼아 스코어링된 롤아웃을 제어된 편집(추가/삭제/교체)으로 변환하는 SkillOpt를 분석한다.
외부 보상 신호 없이 에이전트가 자체적으로 세계 지식을 생성하고 그 지식으로 다운스트림 성능을 높이는 훈련 방법론을 분석한다.
코드가 AI 에이전트 시스템의 기반 인프라로 기능하는 방식을 하네스 인터페이스, 하네스 메커니즘, 멀티에이전트 조율 세 계층으로 체계화한 서베이를 분석한다.
프롬프트, 툴, 메모리를 버전 관리 가능한 ‘프로토콜 리소스’로 추상화해 에이전트가 스스로 개선 루프를 닫는 Autogenesis Protocol(AGP)의 설계와 실험 결과를 분석한다.
NVIDIA가 OpenMDW-1.1 라이선스로 공개한 Nemotron-3-Ultra-550B-A55B는 Mamba-2와 MoE, Attention을 결합한 LatentMoE 하이브리드 아키텍처다.
MiniMaxAI가 공개한 M3은 428B 총 파라미터, 23B 활성 파라미터 MoE 멀티모달 VLM이다.
MiniMax가 공개한 M2.7은 229B 파라미터, FP8 지원, 113종 양자화 변형으로 온프렘 경로가 다양하다.
Moonshot AI의 Kimi K2.6은 1T 총 파라미터 중 32B만 활성화하는 MoE 구조로 dense 32B급 추론 비용을 유지하면서 256K 컨텍스트와 멀티모달을 지원한다.
Z.ai의 GLM-5.2는 DSA(Dynamic Sparse Attention)로 1M 컨텍스트를 2.9x FLOPs 절감하며 처리한다.
Microsoft가 공개한 FastContext-1.0-4B-SFT는 Qwen3-4B를 파인튜닝한 코딩 에이전트 서브에이전트 모델이다.
Google DeepMind가 공개한 DiffusionGemma-26B-A4B-it는 MoE 기반 VLM이되, 텍스트 생성을 autoregressive가 아니라 이산 확산(discrete diffusion)으로 수행한다.
lazarus19가 공개한 Vibe-Coding-Instruct는 Apache-2.0, 110만 개 코딩 instruction-response 쌍 데이터셋이다.
Glint-Research가 공개한 Fable 5(Claude Code) 에이전트 trace 4,665개.
agents-last-exam은 153개 장기 과제로 컴퓨터 사용 에이전트를 평가하는 벤치마크 데이터셋이다.
HTML, CSS, JavaScript, 이미지를 포함한 전체 웹사이트를 로컬 머신에 다운로드할 수 있는 강력한 Go 기반 웹사이트 클로너 Goclone 사용법을 배워보세요.
RAGLight 프레임워크를 마스터하세요.
LangGPT의 구조화된 프레임워크를 사용하여 고품질의 재사용 가능한 프롬프트를 만드는 방법을 배워보세요.
udocker를 사용하여 루트 권한 없이 Docker 컨테이너를 실행하는 방법을 배워보세요.
엔터프라이즈급 보안, 비용 제어, 벤더 유연성을 제공하는 오픈소스 AI 에이전트 오케스트레이터 Shannon의 설치부터 고급 멀티 에이전트 워크플로우까지 완전한 가이드를 제공합니다.
Helm Dashboard에 대한 종합 튜토리얼 - 시각적 인터페이스로 Kubernetes 차트 관리를 단순화하고 리비전 히스토리와 손쉬운 롤백 기능을 제공하는 Helm의 필수 UI 도구.
GitHub Copilot, ChatGPT, Claude 등 AI 기반 코딩 도구를 마스터하여 개발 워크플로우를 가속화하고 더 나은 코드를 빠르게 작성하는 방법을 알아보세요.
기술적 우수성은 모든 커리어의 기초이지만, 진정한 성장을 위해서는 기술적 능력, 제품 사고, 프로젝트 실행, 그리고 인간관계 기술이라는 네 가지 핵심 역량을 균형 있게 발전시켜야 합니다.
LLM 후훈련을 위한 필수 데이터셋과 도구들을 탐구합니다.
농업부터 e스포츠까지 다양한 분야의 엄선된 공개 데이터셋 컬렉션을 통해 전 세계 오픈 데이터 커뮤니티의 노하우를 만나보세요.
NVIDIA가 6백만 개의 다국어 추론 데이터셋을 공개하며 프랑스어, 스페인어, 독일어, 이탈리아어, 일본어 5개 언어로 확장된 고품질 훈련 데이터를 제공합니다.
64만 시간의 오디오 데이터로 구성된 NVIDIA의 최신 다언어 음성 인식 및 번역 데이터셋, Granary의 특징과 활용 방안을 알아봅니다.
PDF, 이미지, 오디오 파일을 자동으로 구조화하는 오픈소스 AI 플랫폼 Rowfill의 핵심 기능과 활용법을 알아보세요.
Node.js/TypeScript로 구축된 AnyCrawl로 웹사이트를 LLM 친화적 데이터로 변환하고, Google/Bing SERP 결과를 효율적으로 수집하는 방법을 마스터해보세요.
ByteDance에서 공개한 Dolphin 프로젝트의 Fox 데이터셋과 벤치마크를 상세히 분석합니다.
RedNote가 공개한 dots.ocr로 다국어 문서 레이아웃 분석과 OCR을 단일 비전-언어 모델에서 구현하는 방법을 알아봅니다.
프로덕션 환경에서 ML 애플리케이션을 구축하기 위해 필요한 핵심 기술 스택과 역량을 정리한 실무 중심 가이드
Vibe Coding과 Agentic Coding이 가져온 새로운 개발 문화를 어떻게 받아들이고 발전시킬 것인가? 과거의 관습에서 벗어나 AI와 함께하는 협업 문화 구축 가이드
15분 설문과 행동 데이터로 팀 궁합을 정량화해 채용부터 온보딩까지 전 과정을 최적화하는 Saberr 알고리즘 활용법
데이터로 숨은 가치를 발굴해 자원 대비 최대 성과를 이끄는 머니볼 전략을 개발·제품·채용에 적용하는 방법
AI 시대의 개발자는 모든 것을 알 필요 없다.
AI 엔지니어링을 시작하려는 분들을 위한 학습 로드맵입니다.
백엔드·인프라 엔지니어 채용을 위한 10대 필독서와 실무 적용 사례를 통해 우리가 찾는 인재상과 채용 기준을 소개합니다.
ThakiCloud의 Three Vs(속도, 검증, 버전관리) 기반 MLOps 문화와 실전 사례, 그리고 함께할 동료를 찾는 채용 안내를 담았습니다.
KCD Seoul 2025에서 발표한 자료를 공유합니다.
Thaki Cloud의 기업 문화, 복지, 개발자들의 이야기, 채용 정보 등을 공유합니다.
Thaki Cloud의 미션, 원칙, 그리고 가치를 공유합니다.
No posts match these filters.