ĐIỂM TIN AI NÓNG - 03/07/2026
Model Releases & Đột phá Công nghệ
- Anthropic / Claude Fable 5: Ngày
02/07/2026, Anthropic công bố thêm chi tiết kỹ thuật choClaude Fable 5sau khi model được triển khai lại toàn cầu, biến một đợt mở lại truy cập thành bản mô tả vận hành khá cụ thể về cách hãng khóa các năng lực cyber rủi ro cao. Điểm đáng chú ý là hãng tách rõ bốn nhóm hành vi classifier phải xử lý:prohibited use,high-risk dual use,low-risk dual use, vàbenign use; các tác vụ như malware development, defense evasion, exploit weaponization và truy cập trái phép đều nằm ở vùng chặn. Anthropic cũng đề xuất thangCyber Jailbreak SeveritytừCJS-0đếnCJS-4, chấm theo bốn trụccapability gain,breadth,ease of weaponizationvàdiscoverability, tức là bắt đầu đưa câu chuyện jailbreak từ mức PR sang ngôn ngữ quản trị rủi ro có thể vận hành được. Với đội dev hoặc security team dùng frontier model, đây là tín hiệu quan trọng vì model release giờ đi kèm spec an toàn đủ chi tiết để đánh giá xem workflow nào sẽ bị false positive và workflow nào cần cơ chế allowlist riêng.Nguồn: Anthropic - More details on Fable 5’s cyber safeguards and our jailbreak framework.
Cập nhật Sản phẩm & Công cụ
- GitHub Copilot / Kimi K2.7 Code: GitHub thông báo ngày
01/07/2026rằngKimi K2.7 Codeđã GA trong GitHub Copilot và đây là modelopen-weightđầu tiên xuất hiện trong model picker của Copilot. Về rollout, model bắt đầu mở choCopilot Pro,Pro+vàMax, dùng được trênVS Code 1.127.0+,Visual Studio 17.14.6+,Copilot CLI,cloud agent,JetBrains 1.9.1+,Xcode,Eclipse,github.comvà mobile; cònBusinessvàEnterprisethì tắt mặc định, admin phải bật policy trước khi người dùng thấy model. Với developer, ý nghĩa lớn nhất không nằm ở benchmark mà ở cấu trúc chi phí và quyền chọn model: Copilot đang dịch chuyển từ “một model mặc định” sang “router nhiều model”, nơi open-weight model bắt đầu chen vào workflow coding thương mại. Tác động cộng đồng cũng khá rõ: bài changelog này lên vị trí số3trên front page Hacker News ngày02/07/2026với402điểm và165bình luận, cho thấy đây không phải thay đổi nhỏ ở tầng UI mà là dấu hiệu thị trường cho cuộc đua model-picker trong IDE.
Nguồn: GitHub Changelog - Kimi K2.7 Code is generally available in GitHub Copilot, Hacker News front page 2026-07-02. - GitHub Copilot / Gemini model deprecation: Ngày
02/07/2026, GitHub tiếp tục báo trước việc gỡGemini 2.5 ProvàGemini 3 Flashkhỏi toàn bộ bề mặt Copilot vào ngày31/07/2026, khuyến nghị chuyển sangGemini 3.1 ProvàGemini 3.5 Flash. Với team đang ghim model ở chat, inline edits, agent mode hay code completions, đây là thay đổi vận hành cần xử lý sớm vì nó ảnh hưởng trực tiếp tới workflow, policy của admin và khả năng tái lập kết quả nếu prompt cũ phụ thuộc hành vi model đã retired. Về thực chất, đây là lời nhắc rằng “hạ tầng agent trong IDE” giờ có vòng đời model ngắn tương tự hạ tầng API; nếu không theo dõi deprecation date và mapping sang alternative model, chất lượng hoặc chi phí có thể đổi đột ngột ngay trong tháng.
Nguồn: GitHub Changelog - Upcoming deprecation of Gemini 2.5 Pro and Gemini 3 Flash.
Nghiên cứu & Học thuật (Báo cáo nổi bật)
- Hugging Face Community / Catching Confident Hallucinations from the Inside: Bài preprint đăng ngày
02/07/2026trên Hugging Face đề xuất cách bắt các hallucination “nói sai nhưng rất tự tin” bằng cách đọc activation bên trong model thay vì chỉ nhìn xác suất token đầu ra. Kết quả nổi bật nhất là một logistic probe đặt trên residual stream đạtAUROC 0.801ở nhóm câu trả lời confident-but-wrong củaTruthfulQA; ngược lại, nếu train probe trên câu tham chiếu sạch rồi áp vào câu model tự sinh, chất lượng không chỉ giảm mà còn đảo dấu từ0.765xuống0.252. Tác giả cũng báo cáo tín hiệu này lặp lại trên bốn model instruction-tuned từ năm tổ chức, dao động0.78đến0.82, và bắt đầu đọc được từ khoảng một phần ba chiều sâu mạng. Đây chưa phải phương án production-ready vì khả năng transfer qua dataset và qua model còn yếu, nhưng về mặt kỹ thuật nó rất đáng theo dõi cho các pipeline agent cần “biết lúc nào nên dừng để kiểm tra” thay vì chỉ tối ưu accuracy thuần.
Nguồn: Hugging Face - Catching Confident Hallucinations from the Inside.
🏷️ Từ khóa Xu hướng (Keywords)
fable-5, cyber-jailbreaks, copilot-model-picker, open-weight-coding-models, hallucination-probes
