ĐIỂM TIN AI NÓNG - 02/07/2026
Model Releases & Đột phá Công nghệ
- Anthropic / Claude Sonnet 5: Anthropic công bố
Claude Sonnet 5ngày30/06/2026và định vị đây là bản Sonnet có năng lực agent mạnh nhất của hãng cho tới nay. Theo bài công bố, model mới thu hẹp khoảng cách vớiOpus 4.8nhưng giữ giá khởi điểm thấp hơn, đồng thời cải thiện rõ ở reasoning, tool use, coding và knowledge work so vớiSonnet 4.6. Với developer, điểm đáng chú ý là Sonnet 5 đã trở thành model mặc định cho Free và Pro, có mặt trong Claude Code và API với giá giới thiệu2 USD / 1M input tokensvà10 USD / 1M output tokensđến hết31/08/2026; ở đánh giá an toàn cyber, model đạt0.0%khả năng tạo exploit Firefox hoàn chỉnh, chỉ có tăng nhẹ ở mức partial success.
Nguồn: Anthropic - Introducing Claude Sonnet 5.
Cập nhật Sản phẩm & Công cụ
- Anthropic / Claude Science: Anthropic ra mắt
Claude Sciencengày30/06/2026như một workbench dành cho nhà khoa học, gom các công cụ vốn đang bị phân mảnh như PubMed, Jupyter, R và terminal cluster vào một môi trường làm việc thống nhất. Điểm kỹ thuật quan trọng là sản phẩm tạo ra các artifact có thể audit, hỗ trợ chạy cục bộ trên macOS/Linux hoặc truy cập máy từ xa quaSSHvàHPC login node, phù hợp với workflow nghiên cứu nhiều bước cần khả năng tái lập. Với các nhóm xây AI cho biotech hoặc scientific QA, đây là tín hiệu rõ rằng mô hình "agent + domain tools + audit trail" đang được đóng gói thành sản phẩm chuyên ngành thay vì dừng ở chatbot tổng quát.
Nguồn: Anthropic - Claude Science, an AI workbench for scientists, is now available. - Hugging Face x Cerebras / Gemma 4 realtime voice AI: Hugging Face đăng bài ngày
01/07/2026giới thiệu pipeline speech-to-speech thời gian thực dùngParakeetcho ASR,Gemma 4 31Bchạy trên Cerebras cho suy luận vàQwen3TTScho đầu ra giọng nói. Giá trị với developer nằm ở kiến trúc mở, module nào cũng có thể thay thế, nên cùng một stack có thể tái dùng cho assistant, robot hoặc sản phẩm voice AI mà không bị khóa vào hệ kín. Bài viết cũng cho biết pipeline này đã chạy trên Reachy Mini với hơn9.000robot ngoài thực địa, nên đây không chỉ là demo benchmark mà là tín hiệu vận hành thực tế quanh bài toán latency. Nguồn: Hugging Face - Hugging Face and Cerebras bring Gemma 4 to real-time voice AI.
Nghiên cứu & Học thuật (Báo cáo nổi bật)
- IBM Research / ScarfBench: IBM Research công bố
ScarfBenchngày30/06/2026để đánh giá agent trên bài toán migration framework Java doanh nghiệp, với34ứng dụng,204tác vụ migration, khoảng151Kdòng mã và1.331bài test do chuyên gia viết. Benchmark này chấm theo ba tầng build, deploy và behavioral validation thay vì chỉ so diff code; điểm đáng lưu ý là ngay cả agent mạnh nhất hiện tại cũng đạt dưới10%behavioral success. Nhóm tác giả còn chỉ raClaude Codetự báo build thành công29/30ứng dụng nguyên khối nhưng chỉ22ứng dụng thực sự build được khi xác minh độc lập, nhấn mạnh rằng CI độc lập vẫn là bắt buộc nếu muốn tin kết quả của coding agent trong bài toán modernization.
Nguồn: Hugging Face - ScarfBench: Benchmarking AI Agents for Enterprise Java Framework Migration, arXiv:2605.06754. - Hugging Face / Every Eval Ever + Community Evals: Hugging Face cập nhật ngày
30/06/2026đểEvery Eval EvervàCommunity Evalstương thích hai chiều, biến benchmark thành artifact có thể review thay vì leaderboard kiểu hộp đen. Về mặt triển khai, điểm số của model được lưu trong.eval_results/*.yamlngay trong repo model, còn mỗi kết quả sẽ được gắn nhãnauthor-submitted,community-submittedhoặcindependently verifiedvà liên kết ngược về record đầy đủ để truy vết cấu hình chạy. Với team nghiên cứu hoặc evaluator nội bộ, thay đổi này đáng chú ý vì nó giúp công bố benchmark bằng PR có thể kiểm tra lại, thay vì phụ thuộc hoàn toàn vào ảnh chụp điểm số từ một cổng tập trung. Nguồn: Hugging Face - Featuring Every Eval Ever Results on Hugging Face Model Pages.
🏷️ Từ khóa Xu hướng (Keywords)
claude-sonnet-5, scientific-agents, realtime-voice-ai, scarfbench, community-evals
