BLUEBUG'S BLOG

"하네스의 핵심은 결국 멀티 에이전트였다"

목차 들어가며 revfactory/harness는 무엇을 만드는 도구인가 하네스 개념의 재정의: 코드가 아니라 경계와 피드백 왜 여러 에이전트를 띄우는 것만으로는 부족한가 품질 향상의 증거와 아직 남은 한계 예상보다 빠르게 진행된 제품 흡수 — 타임라인 검증 흡수된 이후에도 하네스가 사라지지 않는 이유 앞으로 연구해야 ...

프롬프트를 잘 쓰는 사람이 앞서던 시대는 끝나가는가

멀티모달 AI 수렴과 판단력 중심 전환에 대한 검증된 해설 목차 들어가며: 한 사람의 경험에서 시작된 질문 그림 생성 기술은 실제로 얼마나 좋아졌는가 영상 생성의 현재: 좋아졌지만 아직 완벽하지 않은 지점 프롬프트 엔지니어링이라는 기술이 메워온 것 “루프 엔지니어링”: 프롬프트에서 위임으로 넘어가는 담론 텍스트·그림·영상...

GPT-5.6 코딩 에이전트 가성비 지형도: Luna의 반란, Grok 4.5의 등장, 그리고 Fable 5 구독 위기

이게 사실이라면 Luna Max 의 가성비가 심하게 높네요. 특히나 다른 모델 대비 (심지어 동종 상위모델인 Terra, Sol 보다도) effort 를 올리면서 발생하는 가성비 손실이 (차트의 우상향 기울기가 꺾이는 모양새) 가장 적습니다. 저런 모양새라면 Max 이상의 effort 설정도 의미 있지 않나 싶을 정도… Luna Max 의 토큰 ...

Harness와 Loop, 왜 두 개의 레이어로 나눠야 하는가

들어가며 에이전트를 다루는 사람들 사이에서 “내 에이전트 설정”이라는 말은 실제로는 서로 다른 두 개의 시스템을 뭉뚱그려 가리키는 경우가 많다. 하나는 프로젝트가 반복해서 쓰는 실행 바닥이고, 다른 하나는 그 바닥 위에서 매번 새로 도는 순환이다. 앞의 것을 Harness, 뒤의 것을 Loop라고 부른다. 이 문서는 두 레이어를 구분해야 하는 이유와...

여러 AI 모델을 섞어 써도 한계는 명확하다 — '공동 실패 상한(Co-failure Ceiling)' 연구가 말하는 것

목차 왜 이 연구가 지금 중요한가 연구의 출처와 저자 핵심 개념 잡기: 공동 실패율(β)이란 무엇인가 왜 업계 표준 지표인 ‘쌍별 오류 상관관계(ρ)’는 틀렸나 실험 설계: 67개 모델, 21개 provider, 세 개의 도메인 실증 결과 ① — 수학과 코드: 상한이 실제로 발목을 잡는다 실증 결과 ② — 과학 문제: 같은...