코딩 평가에서 신호와 잡음 분리하기
코딩 평가에서 신호와 잡음 분리하기 AI 모델의 코딩 능력 평가는 배포와 안전성 판단에 직접 연결되지만, OpenAI의 감사에서 SWE-Bench Pro 작업 중 약 30%가 깨진 상태로 추정됨 SWE-Bench P
코딩 평가에서 신호와 잡음 분리하기 AI 모델의 코딩 능력 평가는 배포와 안전성 판단에 직접 연결되지만, OpenAI의 감사에서 SWE-Bench Pro 작업 중 약 30%가 깨진 상태로 추정됨 SWE-Bench Pro는 더 긴 작업 범위와 현실적인 과제를 목표로 했으나, 731개 공개 작업에서 통과율이 8개월 만에 23.3%에서 80.3%로 오른 결과를 그대로 믿기 어려워짐 결함은 과도하게 엄격한 테스트, 과소명세 프롬프트,
정리
핵심 요약
코딩 평가에서 신호와 잡음 분리하기 AI 모델의 코딩 능력 평가는 배포와 안전성 판단에 직접 연결되지만, OpenAI의 감사에서 SWE-Bench Pro 작업 중 약 30%가 깨진 상태로 추정됨 SWE-Bench Pro는 더 긴 작업 범위와 현실적인 과제를 목표로 했으나, 731개 공개 작업에서 통과율이 8개월 만에 23.3%에서 80.3%로 오른 결과를 그대로 믿기 어려워짐 결함은 과도하게 엄격한 테스트, 과소명세 프롬프트,
출처: GeekNews
이 아티클로 만든 나만의 공식 0개
아직 이 아티클로 만든 공식이 없어요. 첫 번째 공식을 남겨보세요!
나도 공식 만들기
댓글
0댓글을 남기려면 로그인이 필요해요.
아직 댓글이 없어요. 첫 댓글을 남겨보세요.