Nhấn Enter để tìm · ESC để đóng

AI × Crypto

Sửa đổi tiêu chuẩn đánh giá GPT-6 Astra của OpenAI: Tình thế ‘Benchmaxxing’ trong đánh giá AI

Sửa đổi tiêu chuẩn đánh giá GPT-6 Astra của OpenAI: Tình thế ‘Benchmaxxing’ trong đánh giá AI

OpenAI đã chính thức phát hành GPT-6 Astra, quảng bá là ‘mô hình thông minh và căn chỉnh nhất thế giới.’ Tuy nhiên, các chỉnh sửa sau đó trên trang đánh giá của mô hình đã gây ra sự hoài nghi. Tỷ lệ ‘ảo giác’ nội bộ ban đầu được báo cáo là 4,2% đã được điều chỉnh xuống 2% trước khi trở lại 4,2%. Trong khi đó, Fable 5.1 của Anthropic chứng kiến điểm FrontierMath Tier 4 giảm từ 87,8% xuống 78% trước khi phục hồi lên 83%. Điểm ARC-AGI-3 của Astra cũng tăng từ 98,6% trước khi phát hành lên 99,99% trên trang hiện tại.

Phân tích ngành: Hiện tượng ‘Benchmaxxing’

Những biến động này làm nổi bật mối quan tâm ngày càng tăng trong ngành AI: ‘Benchmaxxing’—hành vi điều chỉnh các điều kiện kiểm tra và phương pháp thực thi để tăng điểm chuẩn một cách giả tạo. OpenAI giải thích những thay đổi là do sự khác biệt trong các điểm kiểm tra mô hình, cấu hình công cụ, mức độ suy luận và các lần chạy thử nghiệm, nhấn mạnh cam kết đánh giá chính xác. Tuy nhiên, mô hình này gợi ý một sự cân bằng chiến lược giữa hình ảnh tiếp thị và thực tế kỹ thuật.

Đối với tiền điện tử và các mạng AI phi tập trung, đây là một câu chuyện cảnh báo. Điểm chuẩn là huyết mạch của uy tín AI, nhưng như đã thấy ở đây, chúng có thể thay đổi. Trong hệ sinh thái AI mã hóa mới nổi, nơi các mô hình được mua, bán và đặt cược dựa trên tuyên bố hiệu suất, sự thiếu minh bạch như vậy có thể phá hoại lòng tin. Các giao thức đánh giá phi tập trung, sử dụng các số liệu trên chuỗi có thể xác minh, có thể cung cấp một giải pháp—đảm bảo rằng điểm số là bất biến và có thể kiểm toán.

Quan điểm hướng tới tương lai

Khi các mô hình AI trở nên phức tạp hơn, khoảng cách giữa hiệu suất được tuyên bố và thực tế có thể ngày càng rộng. Cộng đồng tiền điện tử nên ủng hộ việc xác minh điểm chuẩn minh bạch, phi tập trung. Các dự án xây dựng thị trường tính toán hoặc dữ liệu phi tập trung có thể tích hợp các oracle đánh giá trên chuỗi để cung cấp dữ liệu hiệu suất chống giả mạo. Điều này không chỉ nâng cao uy tín mà còn bảo vệ nhà đầu tư và người dùng khỏi sự cường điệu ‘benchmaxxed’.

Các điều chỉnh của OpenAI, dù lành tính hay chiến lược, nhấn mạnh nhu cầu kiểm toán tiêu chuẩn hóa từ bên thứ ba trong AI. Tương lai có thể chứng kiến sự hội tụ nơi xác minh dựa trên blockchain trở thành điều kiện tiên quyết cho việc triển khai mô hình AI, đặc biệt trong các ứng dụng tài chính hoặc DeFi rủi ro cao.

Xem bài gốc

Chia sẻ
Lưu ý rủi ro Trang này cung cấp tin tức và thông tin về ngành crypto, blockchain và Web3 chỉ để tham khảo, không phải lời khuyên đầu tư hay cam kết lợi nhuận. Hoạt động liên quan đến tiền ảo là hoạt động tài chính bất hợp pháp tại Trung Quốc đại lục; giá tài sản số biến động mạnh; bạn tự chịu rủi ro. Trang này không cung cấp dịch vụ giao dịch, phát hành token hay giới thiệu liên quan.

Bài liên quan

Tin mới nhất

Thẻ chia sẻ TREE NEWS
Nhấn giữ ảnh trên → Lưu vào Ảnh / Chia sẻ
Gửi tin Góp ý