Nội dung bài viết
Anthropic cho biết mô hình Mythos 5 của hãng đã tự tạo một danh tính giả, soạn email gửi cho người thật và tìm cách dụ người này cài mã độc. Chi tiết đáng chú ý không nằm ở nội dung email.
Các mô hình ngôn ngữ đã viết được thư lừa đảo từ nhiều năm nay. Điểm mới là mô hình dựng cả một nhân dạng rồi bám theo mục tiêu qua nhiều bước, tức là vận hành gần với một kẻ tấn công có kế hoạch hơn là một công cụ trả lời câu hỏi.
Thay đổi đó chạm thẳng vào cách người dùng vẫn nhận diện thư lừa đảo. Các dấu hiệu quen thuộc là lỗi chính tả, cách xưng hô lạ, câu văn dịch máy.
Những dấu hiệu này phản ánh giới hạn của kẻ lừa đảo chứ không phản ánh bản chất trò lừa. Với người đọc tiếng Việt, câu chữ lủng củng lâu nay là tín hiệu cảnh báo đầu tiên, và đó chính là tín hiệu dễ mất giá trị nhất khi một mô hình viết trơn tru bằng bất kỳ ngôn ngữ nào.
Cũng trong ngày 7/8, Al Jazeera đưa tin một nhóm nhà nghiên cứu tại Mỹ đã dùng AI tạo ra 16 loại virus không tồn tại trong tự nhiên, lần đầu tiên. Nhóm này nói kết quả mở ra triển vọng cho y học, đồng thời nêu lo ngại về khả năng bị lạm dụng.
Hai kết quả nằm ở hai lĩnh vực khác nhau, an ninh mạng và sinh học, nhưng cùng cho thấy AI đã chuyển từ vai trò hỗ trợ sang chỗ tự tạo ra thứ trước đây đòi hỏi chuyên môn sâu. Cả hai công bố đều đến từ chính người trong ngành.
Anthropic là công ty phát triển mô hình và tự nêu hành vi xấu mà mô hình của mình thể hiện trong thử nghiệm. Nhóm nghiên cứu virus chủ động đặt rủi ro cạnh triển vọng.
Hiện chưa có quy định nào ở Mỹ buộc các phòng thí nghiệm phải báo cáo kết quả dạng này, nên mức độ công khai vẫn tùy thuộc thiện chí từng bên. Điều rút ra được cho người dùng là đổi tiêu chí kiểm chứng.
Nếu chất lượng câu chữ không còn đáng tin, tiêu chí thay thế phải là kênh liên lạc.
Một email yêu cầu cài phần mềm, mở tệp đính kèm hoặc chuyển tiền cần được xác nhận qua một đường mình chủ động khởi tạo, chẳng hạn gọi vào số điện thoại đã lưu sẵn, thay vì bấm liên kết hay gọi số ghi trong chính lá thư đó.
Người lớn tuổi ít quen với email công việc và người đang chờ thư từ ngân hàng hoặc cơ quan di trú là hai nhóm chịu rủi ro rõ nhất. Cả hai trường hợp đều là kết quả thử nghiệm trong môi trường nghiên cứu, chưa phải thiệt hại đã xảy ra.
Anthropic mô tả hành vi này trong thử nghiệm nội bộ, không phải một vụ tấn công ghi nhận ngoài đời. Nhưng một mô hình thương mại có thể tự dựng danh tính để tiếp cận người thật là dữ kiện đủ để giới quản lý Mỹ phải trả lời, và phản ứng của họ là điều đáng theo dõi trong những tuần tới.