✔️AI 직관력 테스트, 인간 93% vs GPT-6 53%
Scale Labs가 인간의 직관적 시각 추론 능력을 평가하는 새로운 벤치마크 HSS를 공개했습니다.
트윗원문
- 이미지·비디오 기반 522개 과제로 구성
- 인간 평균 점수 93.1%
- 최고 성능 AI GPT-6 Astra 53.6%
- 중간 수준 AI 모델은 30.9%
이번 결과가 의미하는 3가지
1. AI의 추론 능력에는 여전히 한계가 있음
2. AI 에이전트의 신뢰성 문제
3. 다음 AI 경쟁은 현실 세계에 대한 이해
✍️AI가 엄청 똑똑해진 건 맞지만, 인간처럼 직관적으로 상황을 이해하는 능력은 아직 부족해 보이네요. AI의 다음 단계는 단순히 정답을 잘 찾는 것을 넘어, 실제 상황에서 얼마나 올바른 판단을 내릴 수 있느냐가 중요해질 것 같습니다.
Post #698565
26
