Skip to content

ĐIỂM TIN AI NÓNG - 02/07/2026

Model Releases & Đột phá Công nghệ

  • Anthropic / Claude Sonnet 5: Anthropic công bố Claude Sonnet 5 ngày 30/06/2026 và định vị đây là bản Sonnet có năng lực agent mạnh nhất của hãng cho tới nay. Theo bài công bố, model mới thu hẹp khoảng cách với Opus 4.8 nhưng giữ giá khởi điểm thấp hơn, đồng thời cải thiện rõ ở reasoning, tool use, coding và knowledge work so với Sonnet 4.6. Với developer, điểm đáng chú ý là Sonnet 5 đã trở thành model mặc định cho Free và Pro, có mặt trong Claude Code và API với giá giới thiệu 2 USD / 1M input tokens10 USD / 1M output tokens đến hết 31/08/2026; ở đánh giá an toàn cyber, model đạt 0.0% khả năng tạo exploit Firefox hoàn chỉnh, chỉ có tăng nhẹ ở mức partial success. Claude Sonnet 5 Nguồn: Anthropic - Introducing Claude Sonnet 5.

Cập nhật Sản phẩm & Công cụ

  • Anthropic / Claude Science: Anthropic ra mắt Claude Science ngày 30/06/2026 như một workbench dành cho nhà khoa học, gom các công cụ vốn đang bị phân mảnh như PubMed, Jupyter, R và terminal cluster vào một môi trường làm việc thống nhất. Điểm kỹ thuật quan trọng là sản phẩm tạo ra các artifact có thể audit, hỗ trợ chạy cục bộ trên macOS/Linux hoặc truy cập máy từ xa qua SSHHPC login node, phù hợp với workflow nghiên cứu nhiều bước cần khả năng tái lập. Với các nhóm xây AI cho biotech hoặc scientific QA, đây là tín hiệu rõ rằng mô hình "agent + domain tools + audit trail" đang được đóng gói thành sản phẩm chuyên ngành thay vì dừng ở chatbot tổng quát. Claude Science Nguồn: Anthropic - Claude Science, an AI workbench for scientists, is now available.
  • Hugging Face x Cerebras / Gemma 4 realtime voice AI: Hugging Face đăng bài ngày 01/07/2026 giới thiệu pipeline speech-to-speech thời gian thực dùng Parakeet cho ASR, Gemma 4 31B chạy trên Cerebras cho suy luận và Qwen3TTS cho đầu ra giọng nói. Giá trị với developer nằm ở kiến trúc mở, module nào cũng có thể thay thế, nên cùng một stack có thể tái dùng cho assistant, robot hoặc sản phẩm voice AI mà không bị khóa vào hệ kín. Bài viết cũng cho biết pipeline này đã chạy trên Reachy Mini với hơn 9.000 robot ngoài thực địa, nên đây không chỉ là demo benchmark mà là tín hiệu vận hành thực tế quanh bài toán latency. Nguồn: Hugging Face - Hugging Face and Cerebras bring Gemma 4 to real-time voice AI.

Nghiên cứu & Học thuật (Báo cáo nổi bật)

  • IBM Research / ScarfBench: IBM Research công bố ScarfBench ngày 30/06/2026 để đánh giá agent trên bài toán migration framework Java doanh nghiệp, với 34 ứng dụng, 204 tác vụ migration, khoảng 151K dòng mã và 1.331 bài test do chuyên gia viết. Benchmark này chấm theo ba tầng build, deploy và behavioral validation thay vì chỉ so diff code; điểm đáng lưu ý là ngay cả agent mạnh nhất hiện tại cũng đạt dưới 10% behavioral success. Nhóm tác giả còn chỉ ra Claude Code tự báo build thành công 29/30 ứng dụng nguyên khối nhưng chỉ 22 ứng dụng thực sự build được khi xác minh độc lập, nhấn mạnh rằng CI độc lập vẫn là bắt buộc nếu muốn tin kết quả của coding agent trong bài toán modernization. ScarfBench Nguồn: Hugging Face - ScarfBench: Benchmarking AI Agents for Enterprise Java Framework Migration, arXiv:2605.06754.
  • Hugging Face / Every Eval Ever + Community Evals: Hugging Face cập nhật ngày 30/06/2026 để Every Eval EverCommunity Evals tương thích hai chiều, biến benchmark thành artifact có thể review thay vì leaderboard kiểu hộp đen. Về mặt triển khai, điểm số của model được lưu trong .eval_results/*.yaml ngay trong repo model, còn mỗi kết quả sẽ được gắn nhãn author-submitted, community-submitted hoặc independently verified và liên kết ngược về record đầy đủ để truy vết cấu hình chạy. Với team nghiên cứu hoặc evaluator nội bộ, thay đổi này đáng chú ý vì nó giúp công bố benchmark bằng PR có thể kiểm tra lại, thay vì phụ thuộc hoàn toàn vào ảnh chụp điểm số từ một cổng tập trung. Nguồn: Hugging Face - Featuring Every Eval Ever Results on Hugging Face Model Pages.

🏷️ Từ khóa Xu hướng (Keywords)

claude-sonnet-5, scientific-agents, realtime-voice-ai, scarfbench, community-evals