특집

Python 3.15 RC2 공개, LLM 테스트는 scikit-learn 휠에 막혔다

원본 · Archive for Tuesday, 1st September 2026
simonwillison.net · 2026-09-11

Python 3.15.0의 마지막 릴리스 후보(RC2)가 공개되며 10월 정식 출시를 앞뒀다. Simon Willison은 자신의 프로젝트로 직접 테스트를 돌려본 결과 대부분 통과했지만, LLM 프로젝트 하나가 scikit-learn의 3.15용 휠이 아직 없다는 이유로 막혀 있다고 전했다. 같은 날 그는 Claude Fable 5.1의 과학 벤치마크 급상승, Codex 앱의 숨겨진 1.7GB 런타임, Dwarf Fortress 제작자의 발언까지 하루치 메모를 모았다.

  • Python 3.15 RC2 — Hugo van Kemenade는 RC2 이후에는 명백한 버그 수정으로 검토된 코드 변경만 허용된다고 공지했으며 정식 출시는 10월로 예정돼 있다.
  • 서드파티 준비 요청 — 릴리스팀은 서드파티 프로젝트 관리자들에게 3.15용 PyPI 휠을 미리 배포해 최종 출시에 대비하라고 강하게 권고했다.
  • 2021년 교훈 — Simon은 2021년 Python 3.10에서 발견한 버그를 RC 기간에 테스트하지 못해 이미 출시된 뒤에야 잡았던 경험 이후 RC 테스트를 훨씬 꼼꼼히 챙기게 됐다고 밝혔다.
  • GitHub Actions 매트릭스 — allow-prereleases와 check-latest 플래그를 쓰면 현재는 RC1을, RC2가 올라오면 자동으로 RC2를 테스트하게 된다.
  • 테스트 결과 — Datasette와 sqlite-utils는 3.15 RC 테스트를 통과했지만 LLM은 scikit-learn의 3.15용 휠이 아직 없어 막혀 있다.
  • execute_sql 변경 — execute_sql이 반환하는 rows가 배열의 배열에서 객체 배열로 바뀌어 약한 모델이 컬럼과 위치를 헷갈리는 문제를 줄이도록 설계했다.
  • Tarn Adams 발언 — Dwarf Fortress 공동제작자 Tarn Adams는 dwarf AI라는 표현을 못 쓰게 돼 이제는 dwarf behavior라고 불러야 한다고 말했다.
  • GeoJSON 지도 도구 — GPT-5.6-Sol에 도구 제안을 요청하자 스스로 도구를 만들었고, Claude Code for web과 Fable 5.1을 거쳐 GeoJSON을 PNG로 내보내는 완성 도구가 나왔다.
  • Codex 앱의 숨은 용량 — OpenAI Codex 데스크톱 앱의 codex-primary-runtime 폴더에 Python, Node.js 전체 설치본과 Poppler, git, LibreOffice 바이너리까지 포함된 1.7GB 캐시가 발견됐다.
  • Fable 5.1 과학 벤치마크 — Anthropic은 Terminal-Bench-Science 0.1에서 Fable 5.1이 52.6점을 기록했다고 밝혔는데, 이는 Fable 5의 24.7점, Opus 5의 29.0점, GPT-5.6 Sol의 22.4점을 크게 웃도는 수치다.

그가 한 말

2021년에 Python 3.10을 상대로 제 테스트 스위트를 돌려서 버그를 발견한 적이 있는데... 그건 RC 기간 중이 아니어서 이미 버그가 출시된 뒤였습니다! 그 이후로 저는 이런 RC들을 훨씬 더 주의 깊게 챙겨보게 되었습니다.Back in 2021 I found a bug in Python 3.10 by running my test suites against it... but I hadn't done this during the RC period, so that bug had already shipped! Since then I've always paid much closer attention to these RCs.
업데이트: Datasette는 통과, sqlite-utils도 통과, LLM은 테스트 스위트에서 선택적으로 쓰이는 scikit-learn의 3.15용 wheel을 기다리느라 현재 막혀 있습니다.Update : Datasette passes , sqlite-utils passes , LLM is currently blocked waiting for a 3.15 wheel for scikit-learn , which is optionally used in the test suite.
그들이 내게서 그 단어들을 빼앗아 갔어요! 이제 나는 '드워프 행동'이라고 말해야 합니다. '드워프 AI'라고는 말할 수도 없어요. 그런 건 존재하지 않으니까요. '드워프 행동'이고, 그들은 가끔 잘못된 행동을 합니다They took the letters from me! I have to talk about dwarf behavior now. I can't even talk about dwarf AI. It doesn't exist. It's dwarf behavior , and they misbehave sometimes301분 0초
Fable 5 24.7% Opus 5 29% GPT-5.6 Sol 22.4% Fable 5.1 52.6%
Terminal-Bench-Science 0.1 점수 — Anthropic의 Claude Fable 5.1 발표 내용 중 벤치마크 수치.

이해관계 · Simon Willison은 자신이 만든 Datasette, sqlite-utils, LLM 프로젝트를 언급하며 관련 테스트 결과를 소개했다.

덧붙임 — 여기에 하나 덧붙이면, Fable 5.1의 다른 벤치마크는 소폭 개선에 그쳤는데 유독 과학 벤치마크만 급등한 점을 Anthropic이 발표에서 유독 강조했다는 사실 자체가 마케팅 포인트를 읽는 힌트가 된다.

오늘 밤 해볼 수 있는 한 가지
본인이 유지보수하는 파이썬 프로젝트가 있다면 GitHub Actions 매트릭스에 allow-prereleases와 check-latest 플래그를 추가해 Python 3.15 RC로 테스트를 한 번 돌려본다.