VentureBeatAI
An eval harness found what qualitative review couldn't: AI models are most confident when wrong
การประเมินด้วยเครื่องมือใหม่พบว่าโมเดล AI มักให้ความมั่นใจสูงสุดเมื่อทำนายผิด ซึ่งบ่งชี้ว่าความมั่นใจของระบบไม่สอดคล้องกับความถูกต้อง – ความมั่นใจมักเป็นสัญญาณของความผิดพลาดมากกว่าความถูกต้อง
#ai