Đóng

Apple ra Audio Intelligence, loạt tính năng AI mới trên Apple Watch

4 tính năng AI mới bao gồm nhận diện âm thanh, nhận diện nhạc, tua lại 15 giây vừa nghe, tự tóm tắt cuộc trò chuyện. Apple khẳng định không ghi âm, không lưu bất kỳ file âm thanh nào.

Bốn tính năng mới, từ nghe tiếng chuông cửa tới "tua lại" câu vừa nói

0 giờ ngày 10/9 theo giờ Việt Nam, tại sự kiện ra mắt các dòng sản phẩm mới, Apple công bố Audio Intelligence trên  Apple Watch Series 12 và Apple Watch Ultra 4 - nhóm tính năng AI hoàn toàn mới dùng micro trên đồng hồ, sức mạnh chip Apple cùng các mô hình AI chạy trên thiết bị và trên đám mây. Theo trang hỗ trợ chính thức của Apple, mục tiêu là giúp người dùng "nhận diện âm thanh, nhận diện nhạc và luôn hiện diện, tập trung trong khoảnh khắc - trong khi vẫn bảo vệ quyền riêng tư ở mọi bước". Audio Intelligence gồm bốn tính năng: Sound Recognition, Music Recognition tích hợp Shazam, Live Rewind và Siri Recap.

Sound Recognition phát hiện các âm thanh quan trọng như chuông báo động, chuông cửa, và báo cho người dùng biết - kể cả khi không mang theo iPhone. Apple nhấn mạnh đây là tính năng "đặc biệt hữu ích với người khiếm thính hoặc nghe kém". Music Recognition tự động nhận diện bài hát đang phát xung quanh và hiện tên bài, tên nghệ sĩ trên Smart Stack mà không cần chạm vào widget.

Hai tính năng còn lại đáng chú ý hơn về mặt tương tác với lời nói của con người. Live Rewind gợi lại những gì vừa được nói trong 15 giây gần nhất bằng cách hiện một đoạn văn bản ngắn trên Apple Watch khi người dùng bấm đúp Digital Crown - giúp bắt kịp điều vừa bỏ lỡ. Siri Recap "âm thầm ghi chú các cuộc trò chuyện trong ngày" và tạo ra bản tóm tắt cấp cao do Apple Intelligence sinh ra, dùng để gợi lại trí nhớ sau này; các bản tóm tắt tự xóa sau 7 ngày nếu người dùng không chọn lưu lại. Live Rewind và Siri Recap sẽ có ở bản beta trong năm nay, bắt đầu bằng tiếng Anh. Điều này có nghĩa chức năng chưa dùng được ngay khi Watch Series 12 lên kệ.

Apple khẳng định không ghi âm, không lưu file âm thanh

Đây là tuyên bố quan trọng nhất và cũng gây tranh cãi nhiều nhất về một thiết bị có khả năng "nghe" và tóm tắt lời nói của người dùng lẫn người xung quanh. Theo Apple: "Âm thanh không được ghi âm hay lưu trữ. Các tính năng Audio Intelligence không tạo ra bản ghi âm nào. Không ai -  hệ điều hành, ứng dụng, chính bạn, hay cả Apple - có thể truy cập được âm thanh đó. Không có bản ghi nào để chia sẻ, chuyển tiếp, hay xuất trình nếu có bên nào yêu cầu, vì đơn giản là không tồn tại bản ghi."

Live Rewind gợi lại những gì vừa được nói trong 15 giây gần nhất bằng cách hiện một đoạn văn bản ngắn trên Apple Watch.

Với Sound Recognition và Live Rewind, toàn bộ quá trình xử lý, kể cả nhận diện giọng nói, diễn ra ngay trên thiết bị. Với Music Recognition, Secure Exclave chỉ tạo ra một "chữ ký âm thanh" của bài hát, một dạng biểu diễn rút gọn không thể lần ngược lại thành âm thanh gốc rồi mới gửi lên máy chủ Shazam để nhận diện.

Với Siri Recap - tính năng nhạy cảm nhất vì tạo ra bản tóm tắt nội dung trò chuyện, Apple mô tả một quy trình nhiều lớp.  Apple khẳng định: "Dữ liệu trong PCC không bao giờ bị lưu trữ hay có thể được Apple hay bất kỳ ai khác truy cập", và mời "các chuyên gia bảo mật độc lập có thể kiểm chứng cam kết này bất kỳ lúc nào".

Apple phân biệt rõ Siri Recap không phải bản ghi lời nói đầy đủ: "Siri Recap không tạo ra bản ghi lời nói đầy đủ. Nó tạo một bản tóm tắt ngắn gọn, cấp cao - tương tự những ghi chú bạn có thể tự viết sau một cuộc trò chuyện". Nội dung nhạy cảm như thông tin tài chính, số định danh của chính phủ, dữ liệu xác thực và một số thông tin cá nhân khác được thiết kế để loại bỏ khỏi bản tóm tắt - dù Apple cũng cảnh báo "bộ lọc tự động có thể không loại bỏ được hết mọi thông tin nhạy cảm.

Bảo vệ cả người xung quanh: không gán tên, có tín hiệu cảnh báo

Một điểm thiết kế đáng chú ý là Apple không chỉ tính tới quyền riêng tư của chủ sở hữu thiết bị, mà cả người đang nói chuyện cùng. Theo thiết kế, các tính năng Audio Intelligence không nhận diện và gán lời nói cho một người cụ thể. Siri Recap có thể chứa tên riêng nếu được nhắc tới trong cuộc trò chuyện, nhưng sẽ không viết kiểu "John nói..." hay gắn nhãn "Người nói A", "Người nói B".

Với Live Rewind, Apple thiết kế tín hiệu cảnh báo cho người xung quanh biết tính năng đang được kích hoạt: một tiếng chuông phát ra từ loa đồng hồ dù đang ở chế độ im lặng hay đang đeo tai nghe, kèm hiệu ứng phủ toàn màn hình và biểu tượng micro hiện lên, cùng thao tác bấm đúp đặc trưng bắt buộc để kích hoạt. Cả hai tính năng Live Rewind và Siri Recap đều phải người dùng tự bật (opt-in), tự chọn khi nào và ở đâu kích hoạt, và có thể xem, sửa, xóa hoặc xuất dữ liệu đã lưu bất kỳ lúc nào trong ứng dụng Siri.

Apple thiết kế tín hiệu cảnh báo cho người xung quanh biết tính năng đang được kích hoạt.

Sound Recognition và Music Recognition cần Apple Watch Series 12 hoặc Ultra 4, ghép cặp với iPhone 11 trở lên (hoặc iPhone SE thế hệ 2 trở lên) chạy iOS 27. Live Rewind và Siri Recap đòi hỏi cấu hình cao hơn - từ iPhone 16 trở lên tới iPhone Duo - và cần bật Apple Intelligence cùng Siri AI (đang ở bản beta); hai tính năng này chưa dùng được ngay, chỉ có ở bản beta trong năm nay, bắt đầu bằng tiếng Anh. Live Rewind và Siri Recap không dành cho người dùng dưới 13 tuổi; với người 13-17 tuổi dùng tài khoản trẻ em, quyền truy cập phải do phụ huynh hoặc người giám hộ bật.

Apple cũng tự đưa ra cảnh báo về độ chính xác, đặt ngay cuối trang công bố: "Các bản tóm tắt Siri Recap và đoạn văn bản Live Rewind được tạo ra bằng Apple Intelligence và có thể không đầy đủ hoặc không chính xác. Các chi tiết quan trọng có thể bị bỏ sót, hiểu sai, hoặc tóm tắt không đúng". Hãng khuyến cáo, khi độ chính xác quan trọng, người dùng nên xác nhận lại thông tin với người liên quan hoặc nguồn khác đáng tin cậy - không nên coi Siri Recap là bằng chứng ghi âm chính xác cuộc trò chuyện.

Nhân Trí