최근 게시물
-
나만의 인사이트
Claude Sonnet 5.5는 Opus를 대신할 수 있을까
세 줄 요약· 오늘 나온 Claude Sonnet 5.5에게 제가 이번 주에 다른 모델들에게 낸 시험 네 가지(기능 과제 다섯 개, 어려운 구조 과제 두 개, 심은 버그 여덟 개, 계산·추론 문제)를 같은 조건으로 풀게 했습니다· 전부 통과했습니다. 기능 과제 10번 모두 완료 기준을 넘었고, 모델이 못 보는 채점 테스트도 만점, 계산·추론 60문제도 세 번 모두 다 맞혔습니다· 값은 대부분 Opus 5.5의 3분의 1에서 절반 사이(추론 세트만 7할쯤)였습니다. 채점 테스트 밖의 까다로운 경우 여섯 가지 중 다섯 가지를 버텨 Opus·Fable과 나란히 섰습니다오늘 Claude Sonnet 5.5가 나왔습니다. 마침 이번 주에 Claude Fable 5.1과 Opus 5.5, GPT-6 세 모델에게 같..
-
나만의 인사이트
AI 벤치마크, 새 문제로 직접 돌려 보면 어떨까?
세 줄 요약· 남들이 코딩·계산·추론 벤치마크를 어떻게 돌리는지 찾아본 뒤, 같은 방식으로 새 문제를 직접 만들어 Claude Fable 5.1·Opus 5.5, GPT-6 Astra·Sol·Luna에게 풀게 했습니다· 심어 둔 버그 8개는 다섯 모델 모두 다 고쳤고, 계산 30문제와 추론 30문제도 세 번씩 풀어 거의 전부 맞혔습니다. 틀린 답은 다 합쳐 다섯 번(서로 다른 문항으로는 세 개)이었습니다· 점수로는 못 가르고, 갈린 건 걸린 시간과 같은 문제를 계속 같은 답으로 틀리는지 같은 습관이었습니다새 AI 모델이 나오면 발표 글마다 벤치마크 표가 붙습니다. 그런데 그 점수가 제가 실제로 시킬 일에서도 그대로 나올지는 늘 궁금했습니다. 그래서 먼저 벤치마크를 만드는 쪽에서는 요즘 어떻게 돌리는지 찾..
-
나만의 인사이트
숨은 테스트는 다 통과했는데, AI 코드는 어디서 갈렸나
세 줄 요약· 오프라인 동기화 엔진과 작업 스케줄러라는 어려운 구조 과제 두 개를 Claude Fable 5.1·Opus 5.5, GPT-6 Astra·Sol·Luna에게 두 번씩 시켰고, 다섯 모델 모두 모델이 볼 수 없는 채점 테스트를 만점으로 통과했습니다· 갈린 건 테스트 밖이었습니다. 평가에서 지적된 모서리 경우 세 가지를 열 개 구현에 직접 넣어 보니 Claude 두 모델은 6개 중 5개, GPT-6 세 모델은 6개 중 2개를 통과했습니다· 한 번 실행 비용은 Luna 약 1센트부터 Fable 약 4.6달러까지 600배 넘게 차이 났고, 비싼 모델일수록 스스로 쓴 테스트가 많았습니다기능 다섯 개를 붙이는 과제에서는 다섯 모델이 모두 통과해서, 모델을 가른 건 시간과 비용, 테스트 습관 정도였습니..
-
나만의 인사이트
Claude Fable 5.1 vs Opus 5.5, 싼 쪽으로 충분할까?
세 줄 요약· Claude Opus 5.5와 Fable 5.1에게 제 보드게임 코드의 기능 과제 다섯 개를 두 번씩 시켰고, 둘 다 10번 모두 완료 기준을 통과했습니다· 한 번 실행에 Opus 5.5는 약 1.56달러·5분 16초, Fable 5.1은 약 5.01달러·9분 20초가 들었습니다. 대신 서로의 코드를 평가하게 하면 둘 다 대부분 Fable 코드를 골랐고, 가장 큰 이유는 Fable이 스스로 테스트를 써 넣었다는 점이었습니다· 같은 Fable 5.1이 3주 전에는 테스트를 한 번도 안 썼는데, 이번에는 10번 중 8번 썼습니다. 달라진 건 Claude Code 버전뿐이었습니다9월 23일에 Anthropic이 Claude Opus 5.5를 내놨습니다. 100만 토큰 기준 입력 4달러·출력 20..