ABM - AI Business Master

Yêu Cầu Quyền Truy Cập VIP

Nội dung này chỉ dành riêng cho thành viên VIP. Vui lòng nâng cấp hoặc gia hạn gói thành viên để truy cập.

Tìm kiếm khóa học

Gõ vào ô bên trên để bắt đầu tìm kiếm trong thư viện khóa học của ABM.

Sóng Não và Dữ Liệu Vật Lý: Chìa Khóa Mở Khóa Tương Lai AI Robot?

Admin admin
27/07/2026
13 phút đọc
27 lượt xem
Sóng Não và Dữ Liệu Vật Lý: Chìa Khóa Mở Khóa Tương Lai AI Robot?

Ranh giới của AI vật lý hiện nay được minh họa qua một trò chơi rút gỗ Jenga diễn ra trong một nhà kho ở San Leandro, California. Nhà kho này thuộc về Encord, một công ty chuyên xây dựng công cụ dữ liệu để huấn luyện các mô hình AI.

Andrew Ceja, một “người huấn luyện robot” theo cách gọi của Encord, đang cẩn thận rút những khối gỗ từ một tòa tháp lung lay trong khi đeo một chiếc tai nghe có camera ghi lại những gì anh nhìn thấy. Việc này đã khá phổ biến để thu thập dữ liệu huấn luyện robot, nhưng chiếc tai nghe của Ceja còn bao gồm các cảm biến đo sóng não của anh ấy khi anh tỉ mỉ tháo dỡ tòa tháp khối.

Encord là một trong số ít nhưng đang ngày càng tăng các startup đang đặt cược rằng hạn chế thực sự tiếp theo đối với robot hình người và robot kho bãi sẽ không phải là kiến trúc mô hình, mà là sự khan hiếm dữ liệu huấn luyện vật lý trong thế giới thực. Thay vì chỉ giúp các công ty robot quản lý dữ liệu hiện có, Encord đang xây dựng một mô hình kinh doanh xoay quanh việc tạo ra dữ liệu mà họ chưa có.

Chiếc tai nghe sóng não mà Ceja đang đeo được chế tạo bởi Zander Labs, một startup khoa học thần kinh của Đức, đang đặt cược rằng việc đo hoạt động của não – để suy luận các trạng thái tinh thần như lỗi, ý định và sự ngạc nhiên – có thể tạo ra một bộ dữ liệu hữu ích hơn để huấn luyện các mô hình. Công việc hợp tác của Encord với Zander hiện đang trong giai đoạn thử nghiệm; Encord cho biết mục tiêu là xây dựng một bộ dữ liệu ban đầu được gắn thẻ sóng não, chạy qua các mô hình robot của khách hàng và đánh giá xem liệu nó có thực sự cải thiện hiệu suất trước khi quyết định mở rộng hay không.

Lucas Gehrke, một nhà khoa học thần kinh của Zander giám sát công việc, cho biết lượng hoạt động não được sử dụng tại bất kỳ thời điểm nào trong một nhiệm vụ nhất định cung cấp manh mối cho các nhà xây dựng mô hình đang cố gắng tìm ra khi nào họ cần triển khai các mô hình cần nhiều nỗ lực nhất. Đây là “mũi nhọn” của nỗ lực giải quyết nút thắt cổ chai dữ liệu robot, theo Vineeth Velmurugan, người đứng đầu bộ phận học máy robot của Encord.

Một cựu binh của phòng thí nghiệm robot của OpenAI và Berkshire Grey (công ty tự động hóa kho bãi), Velmurugan đã gia nhập Encord để xây dựng đội ngũ tạo dữ liệu nội bộ của công ty. Encord được thành lập để giúp các công ty xây dựng ứng dụng thị giác máy tính chú thích dữ liệu và đánh giá mô hình. Khi khách hàng của họ – Velmurugan nói rằng họ làm việc với nhiều công ty robot hàng đầu nhưng anh không được phép tiết lộ tên – bắt đầu áp dụng học máy đầu cuối (end-to-end learning) cho các nhiệm vụ thao tác robot, các nhà điều hành nhận ra họ sẽ phải tự sản xuất dữ liệu huấn luyện, thay vì chỉ đơn thuần quản lý nó. Velmurugan nói: “Dữ liệu đơn giản là không tồn tại.”

Giả định rằng AI tạo sinh có thể làm cho robot những gì nó đã làm cho chatbot đang vấp phải cùng một rào cản này. Các mô hình ngôn ngữ lớn (LLM) được xây dựng dựa trên dữ liệu văn bản của toàn bộ internet, và hơn thế nữa. Việc tìm kiếm cùng loại nguyên liệu thô để dạy mạng nơ-ron về thao tác vật lý là một thách thức: các công ty xe tự lái tự thu thập dữ liệu, nhưng rất khó để mở rộng quy mô. Huấn luyện từ video có thể hiệu quả, nhưng nó thiếu độ chân thực của dữ liệu thế giới thực. Velmurugan ước tính cần một bộ dữ liệu có kích thước gấp khoảng năm lần kho video khổng lồ của YouTube để tạo ra đột phá – một quy mô giúp giải thích tại sao việc tự tạo dữ liệu đã trở thành một ngành kinh doanh chứ không chỉ là một vấn đề nghiên cứu.

Đáp ứng nhu cầu dữ liệu góc nhìn chủ quan của bạn

Các công ty xây dựng bộ não robot hiện đang chuyển sang hai nguồn chính:

  • Video “góc nhìn chủ quan” được thu thập bởi công nhân đeo camera, thường được bổ sung thêm góc camera và các số liệu khác.
  • Thu thập dữ liệu từ robot được vận hành từ xa.

Encord thực hiện cả hai, thu thập dữ liệu góc nhìn chủ quan từ một số nhà máy trên toàn cầu và sử dụng cơ sở ở San Leandro để thử nghiệm các phương thức mới, như sóng não, hoặc thu thập các bộ dữ liệu về các kỹ năng cụ thể để tinh chỉnh. Khi TechCrunch đến thăm, các “người huấn luyện robot” đang sử dụng hệ thống điều khiển robot song song – hai cánh tay robot, một được điều khiển trực tiếp bởi người vận hành và một mô phỏng các chuyển động của nó – để tạo dữ liệu về các nhiệm vụ như rót cà phê từ ấm vào cốc (rất dễ đổ) và xếp chip poker. Velmurugan nói: “Mọi công ty robot hình người đều đã yêu cầu chúng tôi những mảnh ghép này.”

Các kệ chứa đầy hộp hoa giả trong bình, sách, rau nhựa, khay và xẻng dọn chất thải cho mèo, túi và bó dây điện, những mặt hàng dùng để huấn luyện robot thao tác cho các nhiệm vụ gia đình. Tại một trong những trạm này, một “người huấn luyện” khác, Sofia Infante, điều khiển cánh tay robot để cắm và rút cáp ethernet từ phía sau một máy chủ – loại công việc mà các nhà điều hành trung tâm dữ liệu rất muốn được tự động hóa, nếu robot có thể thao tác chúng với độ chính xác cần thiết. Khi thử điều khiển, tôi có thể thấy tại sao điều đó vẫn còn ngoài tầm với: Kìm kẹp kém khéo léo hơn ngón tay người rất nhiều và thiếu các bậc tự do mà chúng ta coi là hiển nhiên ở cánh tay của mình.

Một phương thức dữ liệu mới khác mà Encord đang phát triển sử dụng một bộ cảm biến được gắn vào cẳng tay để phát hiện tín hiệu điện trong cơ bắp. Video quay bàn tay người thao tác vật thể thường không ghi lại toàn bộ bàn tay, nhưng Velmurugan hy vọng sẽ xây dựng một mô tả 3D về vị trí bàn tay tại bất kỳ thời điểm nào dựa trên các cảm biến ở cánh tay, tạo ra sự hiểu biết mạnh mẽ hơn cho các mô hình.

Các bộ dữ liệu của Encord được chú thích bằng các mô tả vật lý về những gì mỗi video chứa – “bàn tay phải siết chặt bu-lông” – để hỗ trợ các mô hình dựa trên LLM trong việc hiểu những gì đang xảy ra. Velmurugan ước tính loại chú thích chi tiết này có giá trị gấp 100 lần so với “dữ liệu góc nhìn chủ quan chất lượng thấp” để huấn luyện các nhiệm vụ cụ thể, và chi phí sản xuất chỉ gấp 20 lần, đây là một sự đánh đổi tốt trên lý thuyết.

Nhưng “gấp 20 lần” vẫn là một khoản tiền thực tế, và đó là vấn đề: thu thập dữ liệu văn bản từ internet, cách các nhà sản xuất LLM xây dựng mô hình của họ bằng cách lấy từ Stack Overflow và phần còn lại của web, hầu như không tốn chi phí gì cho các phòng thí nghiệm tiên phong. Tạo ra dữ liệu huấn luyện vật lý thì không, và đó là giới hạn của việc so sánh AI vật lý với LLM. Loại dữ liệu này phải được sản xuất, không chỉ thu thập, và điều đó thay đổi kinh tế học của việc xây dựng các mô hình này.

Velmurugan nói rằng sự tiến bộ đang được thực hiện – với khả năng quan sát các chương trình trong toàn ngành của Encord, anh ấy có thể thấy các startup và các phòng thí nghiệm tiên phong đều tìm ra những gì hiệu quả và không hiệu quả để cải thiện các mô hình AI vật lý. Vị trí thuận lợi đó – nằm giữa nhiều công ty robot cùng một lúc – cũng là một phần trong đề xuất giá trị của Encord. Nó có thể phát hiện những kỹ thuật dữ liệu nào đang được ngành công nghiệp chấp nhận rộng rãi trước khi bất kỳ khách hàng nào có thể.

Điều đó sẽ giữ cho hàng chục “người huấn luyện robot” tại cơ sở của Encord bận rộn. Cả Infante và Ceja đều là một phần của lực lượng lao động đang phát triển, xây dựng các khối nền tảng cho mạng nơ-ron; họ trước đây đã làm việc tại Scale, một công ty chú thích dữ liệu AI khác, trước khi gia nhập Encord. Ceja từng làm việc tại một công ty quản lý chất thải, nơi niềm yêu thích công nghệ của anh đã khiến anh phụ trách việc giữ cho một máy phân loại rác robot hoạt động tốt. Bây giờ, khi tòa tháp Jenga đổ, anh nói rằng anh rất thích thử thách giải quyết các nhiệm vụ huấn luyện cho robot – “Mỗi ngày đều có điều gì đó mới mẻ!”

Nguồn tham khảo: TechCrunch

Zalo Chat