Skip to content

ĐIỂM TIN AI NÓNG - 25/06/2026

Model Releases & Đột phá Công nghệ

  • Không ghi nhận model release frontier mới từ OpenAI, Anthropic, Google DeepMind và Hugging Face trong cửa sổ quét ngày 25/06/2026: Trong 24 giờ gần nhất, các nguồn ưu tiên không công bố thêm một model tổng quát tầm cỡ như GPT, Claude, Gemini hay một system card mới đủ lớn để đưa vào mục phát hành mô hình. Thay vì có model mới, trọng tâm kỹ thuật hôm nay chuyển sang tầng hạ tầng và benchmark sát deployment hơn. Nguồn đối chiếu: OpenAI News, Anthropic News, Google Research Blog, Hugging Face Blog.
  • OpenAI / Jalapeno inference chip: OpenAI công bố ngày 24/06/2026 chip suy luận tùy biến đầu tiên hợp tác cùng Broadcom, đặt tên Jalapeno. Bài công bố nêu rõ đây là một accelerator tối ưu cho suy luận LLM, đã tape-out trong 9 tháng, đã chạy workload trong lab ở mức tần số và điện năng mục tiêu, trong đó có GPT-5.3-Codex-Spark; OpenAI cũng cho biết kiểm thử sớm cho thấy hiệu năng trên mỗi watt tốt hơn trạng thái hiện đại. Điều quan trọng với dev và doanh nghiệp là thông điệp chiến lược: OpenAI đang đẩy sâu xuống lớp chip, networking và rack system để hạ chi phí suy luận và tăng độ ổn định cho ChatGPT, Codex và API thay vì chỉ dựa vào model cấp cao hơn. Nguồn: OpenAI - OpenAI and Broadcom unveil LLM-optimized inference chip.

Cập nhật Sản phẩm & Công cụ

  • NVIDIA / NeMo AutoModel trên Hugging Face: Bài viết enterprise đăng ngày 24/06/2026 mô tả cách NVIDIA NeMo AutoModel build trên Transformers v5 để fine-tune MoE mà không đổi API from_pretrained(). Theo số liệu NVIDIA công bố, cách này đạt 3.4-3.7x training throughput cao hơn và giảm 29-32% bộ nhớ GPU so với Transformers v5 gốc trong bài toán fine-tune MoE. Với team hạ tầng model, điểm đáng chú ý là nó giữ ergonomics quen thuộc của Hugging Face nhưng thêm expert parallelism, DeepEP và TransformerEngine kernels, nên phù hợp cho workflow cần tăng tốc train mà không muốn viết lại stack huấn luyện. Nguồn: Hugging Face - Accelerating Transformers Fine-Tuning with NVIDIA NeMo AutoModel.

Nghiên cứu & Học thuật (Báo cáo nổi bật)

  • Google Research / Thinking to Recall: Google Research đăng bài ngày 24/06/2026 cho thấy reasoning trace không chỉ giúp bài toán logic phức tạp mà còn có thể mở khóa khả năng nhớ lại sự kiện đơn giản trong LLM. Nhóm tác giả quy về hai cơ chế: computational buffer (thêm token để mở rộng "đường băng" tính toán) và factual priming (gợi lại các sự kiện liên quan để kích hoạt đáp án đúng), đồng thời cảnh báo rằng nếu chuỗi trung gian có một fact hallucinated thì khả năng trả lời đúng giảm rõ rệt. Với người xây workflow agent và eval, bài này có giá trị thực dụng vì nó gợi ý cách ưu tiên các reasoning trajectory có fact kiểm chứng được thay vì mặc định tin mọi chuỗi suy nghĩ dài hơn là tốt hơn. Nguồn: Google Research - Thinking to recall: How reasoning unlocks parametric knowledge in LLMs.
  • Hugging Face / FFASR Leaderboard: Hugging Face và Treble Technologies công bố ngày 24/06/2026 leaderboard FFASR, được mô tả là benchmark mở đầu tiên cho far-field ASR trong điều kiện deployment thực tế. Bài viết nêu benchmark này đánh giá trên 9 điều kiện, trong đó điểm xếp hạng chính hiện tại dựa vào 4 điều kiện gồm near-field, far-field high SNR, mid SNR và low SNR; nhóm tác giả nhấn mạnh rằng WER far-field low SNR của các model nộp lên hiện cao hơn nhiều lần so với near-field trên cùng nội dung. Với các đội voice agent, meeting transcription và robot, đây là tín hiệu quan trọng vì benchmark này bắt đầu đo đúng khoảng cách giữa demo đẹp và hiệu năng ngoài đời thật. Nguồn: Hugging Face - Introducing the FFASR Leaderboard: Benchmarking ASR in the Real World.

Từ khóa Xu hướng (Keywords)

inference-chip, moe-finetuning, far-field-asr, reasoning-traces, factual-priming