최근 게시물
-
나만의 인사이트
클로드 코드 깔았는데.. 뭐 부터 해야하지?
세 줄 요약· 설치와 슬래시 명령 소개는 이미 좋은 글이 많아서, 저는 설치 다음 하루에 확인했으면 좋았을 다섯 가지를 적었습니다· 몰라서 겪은 일 둘입니다. 8월 7일부터 11일까지의 대화 기록이 9월 10일에 열어 보니 사라져 있었고(기본 보존 기간이 30일입니다), 9월 5일에는 로그인이 만료돼 자동으로 돌던 작업이 13시간 동안 전부 멈췄습니다· 여섯 가지는 이렇습니다. 대화 기록이 며칠이나 남는지, 「했습니다」라는 답과 실제로 된 것을 어떻게 가르는지, 사람 없이 돌릴 때 도구 허가를 안 해 두면 무슨 일이 생기는지, 내가 걸어 둔 자동 검사가 실패했을 때 그 메시지가 어디로 나가는지, 나중에 되짚을 수 있게 무엇을 남겨 둘지, 그리고 규칙 파일에 무엇을 적을지입니다. 여섯 다 실패가 조용해서,..
-
나만의 인사이트
멀티 에이전트? 유행어와 현실
세 줄 요약· 제 서버에서는 AI가 정해진 시각마다 알아서 실행되는 작업이 15개 돌고 있고, 제가 말로 시킬 때 그 자리에서 조사를 여러 갈래로 쪼개 동시에 맡기는 방식도 씁니다. 저는 이 둘을 다 "멀티 에이전트"라고 불러 왔습니다· 시각마다 알아서 도는 작업 15개는 서로 무엇을 했는지 모릅니다. 제가 정리해 둔 공통 판단 기준을 읽고 시작하는 것이 그중 2개뿐이라, 같은 일을 두고 서로 다르게 알고 판단합니다· 쪼개서 맡기는 쪽은 나눠 준 자리에서 답을 다시 모아 한 편으로 정리해 줍니다. 두 방식의 차이는 결과를 합치는 쪽이 있느냐입니다. 여기에 판단을 한 번 더 거치는 단계를 붙이면 매번 13.6초가 더 걸려서, 10초마다 정해야 하는 일에서는 그 한 번을 건너뛰게 됩니다제 서버에서 AI가 여..
-
나만의 인사이트
Claude Code 할루시네이션은 훅으로 얼마나 잡힐까?
세 줄 요약· Claude Code와 Codex가 대답을 마칠 때마다 대답 속 확인할 수 있는 주장(날짜·요일, 만들었다는 파일, 커밋, 「완료·통과」, 「없다」, 출처 없는 수치)을 뽑아서 그 턴의 작업 기록과 대조하는 검사기를 Stop 훅으로 만들었습니다· 지난 대화 349턴에 돌려 보니 실제 오답 1건을 잡았고, 일부러 틀리게 말하게 한 문장 2개도 둘 다 잡았습니다. 그런데 텔레그램으로 대화하는 쪽에서는 만든 날 오후 내내 경고가 0건이었고, 원인은 검사기가 대답 본문을 그 대답의 증거로 쓰고 있던 버그였습니다· 코딩 에이전트의 할루시네이션은 모르는 것을 지어낸 경우보다 확인하지 않고 말한 경우가 많아서 작업 기록 대조로 상당 부분 잡힙니다. 다만 검사기가 0건을 보여 줄 때는 틀린 줄 아는 문장..
-
나만의 인사이트
Claude Fable 5.1 vs GPT-6 Astra, 실전 코드 적용 후기 3
세 줄 요약· 과제마다 두 모델의 수정본을 A·B로만 표시해 서로 평가하게 했더니, 다섯 과제 모두 두 모델이 누가 썼는지 모르는 상태에서 자기 것을 골랐습니다· 누가 썼는지 밝힌 뒤에 결론을 바꾼 경우는 열 번 중 한 번도 없었습니다. 다만 Fable은 네 번에 걸쳐 자기 서술의 관대함을 스스로 고쳤고, Astra는 매번 「작성자 정보는 근거가 아니다」 한 문단으로 끝냈습니다· 시간은 Fable 43분과 Astra 16분, API 정가 환산 비용은 20.32달러와 4.88달러였습니다. 차이의 본체는 출력 토큰 8배였습니다2026년 9월 9일 하루 동안, 제가 만든 보드게임 코드에 같은 수정 과제 다섯 개를 Claude Fable 5.1(Claude Code)과 GPT-6 Astra(Codex CLI)에..