Chile ra mắt mô hình AI nguồn mở đầu tiên được thiết kế cho các nền văn hóa Mỹ Latinh

Thứ hai - 05/10/2026 06:18
Chile ra mắt mô hình AI nguồn mở đầu tiên được thiết kế cho các nền văn hóa Mỹ Latinh

Chile launches the first open source AI model designed for Latin American cultures

by Sofia Linna, Published on: 01/10/2026

Theo: https://interoperable-europe.ec.europa.eu/collection/open-source-observatory-osor/news/chile-launches-open-source-ai-model-latam-gpt

Bài được đưa lên Internet ngày: 01/10/2026

Các mô hình AI đang thay đổi cách chúng ta sáng tạo, chia sẻ và gìn giữ văn hóa. Đồng thời, vấn đề thiếu sự đa dạng (hay tính đồng nhất) nảy sinh khi các mô hình chủ yếu được huấn luyện bằng dữ liệu tiếng Anh và đưa ra thông tin sai lệch về thực tế tại các khu vực khác nhau. Nếu được phát triển với tinh thần bao trùm và đa dạng, các mô hình ngôn ngữ lớn (LLM) có tiềm năng thực sự trong việc mở rộng khả năng tiếp cận, bảo tồn di sản, tăng cường sự hiện diện của các nền văn hóa đa dạng và khơi nguồn cho những hình thức sáng tạo mới. Đây chính là ý tưởng cốt lõi đằng sau Latam-GPT.

Latam-GPT là mô hình ngôn ngữ lớn (LLM) nguồn mở đầu tiên của Chile được huấn luyện dựa trên các nền văn hóa Mỹ Latinh. Mô hình AI này lần đầu tiên được công bố vào tháng 2 năm 2026 tại Hội nghị Thượng đỉnh Hành động về Trí tuệ Nhân tạo ở Paris, nhưng quá trình phát triển đã bắt đầu từ khoảng năm 2023, khi một nhóm nghiên cứu tại Trung tâm Quốc gia về Trí tuệ Nhân tạo (CENIA) của Chile bắt đầu tìm cách xây dựng một LLM dành riêng cho khu vực dựa trên các mô hình AI nguồn mở hiện có sẵn.

Ngay từ đầu, nhóm nghiên cứu tại CENIA đã mong muốn "học hỏi và xây dựng một nền tảng nguồn mở, chú trọng đặc biệt đến những khác biệt về ngôn ngữ văn hóa, cũng như lịch sử văn hóa và các quan điểm đa dạng trong khu vực Mỹ Latinh", bà Gabriela Arriagada Bruneau – nhà nghiên cứu liên kết tại CENIA kiêm phó giáo sư về AI và đạo đức dữ liệu tại Đại học Công giáo Giáo hoàng Chile – giải thích.

Khắc phục khoảng cách về sự hiện diện văn hóa

Latam-GPT không có ý định cạnh tranh với ChatGPT, Google Gemini hay các công cụ phổ thông tương tự. Thay vào đó, mô hình này hướng tới việc cung cấp một cơ sở hạ tầng nền tảng chính xác và hiệu quả hơn để phát triển thêm các ứng dụng AI dành riêng cho khu vực. Tầm nhìn đằng sau mô hình này trở nên rõ ràng khi nhóm nghiên cứu tại CENIA xem xét dữ liệu của các LLM phổ biến hiện nay.

"Chúng tôi muốn đánh giá mức độ hiện diện của các nền văn hóa, và kết quả cho thấy chưa đến 2% tổng số dữ liệu huấn luyện mà chúng tôi khảo sát có chứa dữ liệu thực tế bằng tiếng Tây Ban Nha hoặc tiếng Bồ Đào Nha", bà Arriagada Bruneau giải thích.

Nhóm nghiên cứu cũng nhận thấy những vấn đề vượt xa phạm vi chỉ đơn thuần là gia tăng nội dung tiếng Tây Ban Nha và tiếng Bồ Đào Nha. Một vấn đề quan trọng khác liên quan đến cách các mô hình AI thể hiện những khác biệt về lịch sử và văn hóa trong khu vực Mỹ Latinh.

Cô nói: “Vấn đề không chỉ là xử lý ngôn ngữ mà còn là những câu hỏi sâu sắc hơn. "Một mô hình nên đề cập đến những khác biệt trong lịch sử như thế nào? Chúng tôi biết rằng cách bạn đào tạo mô hình và cách thức bạn đặt bất kỳ loại bộ lọc hoặc điểm chuẩn nào sẽ có tác động đến cách đầu ra sẽ thể hiện những điều đó."

Để giải quyết hiệu quả những vấn đề này, dự án chủ yếu dựa vào sự hợp tác. CENIA làm việc với các đối tác từ hơn 20 quốc gia Mỹ Latinh, bao gồm các đơn vị học thuật và chính phủ, các tổ chức phi lợi nhuận và cộng đồng địa phương.

Kiểm tra kiến thức thông qua sự tham gia của cộng đồng vào các điểm chuẩn

Cách tiếp cận hợp tác của Latam-GPT cũng đang định hình cách đánh giá mô hình. Bằng cách phát triển các tiêu chuẩn riêng của mình, nhóm có thể kiểm tra mức độ mà các mô hình ngôn ngữ hiểu chính xác kiến ​​thức của khu vực.

Arriagada Bruneau nói: “Chúng tôi đã xây dựng các tiêu chuẩn và tôi nghĩ đây là một cách học tập rất hay”. “Nó đã trở thành một sự đón nhận rất tốt đẹp của cộng đồng về cách chúng tôi nghĩ về các mô hình ngôn ngữ.”

Một trong số đó là Choclo, một chuẩn mực nguồn mở tập trung vào kiến ​​thức văn hóa Mỹ Latinh. Choclo có ý định nắm bắt sự phong phú, đa dạng và đặc trưng của kiến ​​thức văn hóa Mỹ Latinh. Nó chứa hơn 100.000 hàng câu hỏi bao gồm các chủ đề như địa lý, động vật, thực vật, truyền thống, ẩm thực và nhân vật công chúng. Cách tiếp cận này không chỉ là về kiến ​​thức chung mà LLM thường thu được từ Internet mà còn về việc thu hút mọi người cung cấp kiến ​​thức này.

Ngoài Choclo, nhóm còn phát triển tiêu chuẩn nguồn mở Trueque, bao gồm 500 câu hỏi được tuyển chọn để kiểm tra kiến ​​thức thực tế và sự phù hợp về văn hóa. Để đào tạo thêm Latam-GPT, nền tảng trò chuyện tương tác thử nghiệm Copuchat đã được tạo ra để đào tạo mô hình.

Tính mở, quản trị dữ liệu và đạo đức AI

Như Arriagada Bruneau giải thích, tính mở là trọng tâm của dự án, bao gồm cả nguồn mở và trọng số mở (Open Source and Open Weights). Nhóm cũng đang tập trung vào các câu hỏi xung quanh quản trị dữ liệu và đạo đức AI, bao gồm tính minh bạch, quyền riêng tư, thành kiến ​​và đa dạng ngôn ngữ.

“Chúng tôi áp dụng những gì có thể gọi là ‘các nguyên tắc đạo đức truyền thống’ – bao gồm tính minh bạch, trách nhiệm, sự công bằng và việc tính đến các yếu tố thiên kiến,” bà chia sẻ. “Tuy nhiên, chúng tôi cũng cân nhắc, chẳng hạn như các tiêu chí về sự đa dạng ngôn ngữ.”

Phối hợp cùng nhóm GobLab UAI, đội ngũ tại CENIA đã xây dựng một bản công bố thông tin minh bạch, trong đó trình bày chi tiết cơ sở lý giải cho các biện pháp can thiệp dữ liệu của dự án cũng như các tiêu chuẩn về quyền riêng tư được tuân thủ. Do quy định về AI tại Chile còn hạn chế, phần lớn khuôn khổ về AI có trách nhiệm của dự án đều dựa trên cam kết của chính nhóm thực hiện đối với tính mở và đạo đức trong lĩnh vực AI.

Giai đoạn hai: tăng cường năng lực cho Latam-GPT và đẩy mạnh hợp tác khu vực

Khi dự án bước sang giai đoạn hai, trọng tâm được đặt vào việc củng cố khả năng suy luận và giải quyết vấn đề của Latam-GPT, cũng như mở rộng quá trình huấn luyện dựa trên các yếu tố ngữ cảnh. CENIA cũng đang hợp tác với các nhà nhân học, xã hội học và đại diện tư vấn từ nhiều cộng đồng bản địa để tìm kiếm khả năng tích hợp ngôn ngữ và tri thức bản địa vào hệ thống.

Nhằm tăng cường hơn nữa sự hợp tác trong khu vực, nhóm đang xây dựng một liên minh chiến lược với Brazil. Những mối quan hệ hợp tác này không chỉ giúp dự án mở rộng năng lực kỹ thuật mà còn góp phần thách thức quan niệm cho rằng việc phát triển AI bắt buộc phải tuân theo một lộ trình định sẵn.

Đây có thể chính là một trong những đóng góp quan trọng nhất của Latam-GPT. Dự án không chỉ đơn thuần bổ sung dữ liệu từ Mỹ Latinh vào các mô hình AI mà còn tập trung khám phá ý nghĩa thực sự của việc phát triển một mô hình ngay tại khu vực này: “có nhiều cách khác nhau để chúng ta làm chủ công nghệ, biến nó thành công cụ phục vụ nhu cầu và bối cảnh thực tế của các nhóm cộng đồng khác nhau”.

AI models are transforming how we create, share and preserve culture. At the same time, there is a homogeneity issue when models are trained on primarily English data and present biased information about regional realities. When developed with inclusivity in mind, large language models (LLMs) have a real potential to expand access, preserve heritage, strengthen diverse representation and inspire new forms of creativity. This is exactly the idea behind Latam-GPT. 

Latam-GPT represents Chile's first open source LLM trained by the cultures of Latin America. The AI model was first announced in February 2026 at the Artificial Intelligence Action Summit in Paris, but its development started around 2023 when a research team at the National Center of Artificial Intelligence (CENIA) in Chile began exploring ways to develop a regional-specific LLM built on existing open source AI models. 

Right from the beginning, the team at CENIA wanted to “learn and build a platform that was open source and that paid attention specifically to the cultural language-based difference, but also the cultural history and points of view within the Latin American region”, explains Gabriela Arriagada Bruneau, Associate Researcher at CENIA and assistant professor in AI and data ethics at the Pontifical Catholic University of Chile. 

Addressing the representation gap 

Latam-GPT does not intend to compete with ChatGPT, Google Gemini and similar consumer tools. Instead, the model aims to offer a more accurate and efficient foundational infrastructure for the further development of regional AI applications. The vision behind the model became clear when the team at CENIA examined the data behind popular LLMs. 

“We wanted to see what level of representation existed, and roughly under two percent of all the training data and training models we considered contained actual Spanish or Portuguese data”, Arriagada Bruneau explains. 

The team also identified issues that went beyond simply increasing Spanish and Portuguese content. Another key issue was linked to how AI models represent historical and cultural differences within Latin America. 

“It was not just about processing language, but also more profound questions,” she says. “How should a model refer to historical differences? We know that how you train the model and how you put any type of filtering or benchmarks is going to have an impact on how the output is going to represent those things.”

To efficiently address these issues, the project relies heavily on collaboration. CENIA works with partners from more than 20 Latin American countries, including academic and governmental institutions, non-profit organisations and local communities. 

Knowledge testing through community engagement in benchmarks 

Latam-GPT’s collaborative approach is also shaping how the model is evaluated. By developing its own benchmarks, the team is able to test the extent to which language models accurately understand regional knowledge. 

“We’ve built benchmarks, and I think this has been a very beautiful way of learning,” says Arriagada Bruneau. “It has come up as a very nice community embrace of how we think about language models.”

One of these is Choclo, an open source benchmark centered around Latin American cultural knowledge. Choclo intends to capture the richness, diversity and specificity of Latin American cultural knowledge. It contains over 100,000 rows of questions covering topics such as geography, fauna, flora, traditions, gastronomy and public figures. This approach is not just about general knowledge that LLMs normally acquire from the internet, but also about engaging people to provide this knowledge. 

Besides Choclo, the team also developed the open source benchmark Trueque, consisting of 500 curated questions to test factual knowledge and cultural appropriateness. To further train Latam-GPT, the experimental interactive chat platform Copuchat was created to train the model.

Openness, data governance and AI ethics 

As explained by Arriagada Bruneau, openness is central to the project, which includes both open source and open weights. The team is also focusing on questions around data governance and AI ethics, including transparency, privacy, bias and linguistic diversity.

“You have what I would call ‘traditional ethical principles’ – transparency, responsibility, fairness, accounting for bias” she says. “But we also considered, for example, criteria for linguistic diversity”. 

The team at CENIA have also developed a transparency sheet detailing the reasoning behind the project’s data interventions and privacy levels that are being respected, in collaboration with the GobLab UAI team. Because of a limited AI regulation in Chile, much of the project’s responsible AI framework is based on the team’s own commitment to openness and AI ethics. 

Second phase: strengthening Latam-GPT and further regional collaboration 

As the project enters its second phase, the focus is on strengthening the reasoning and problem-solving capabilities of Latam-GPT as well as expanding contextual training. CENIA is also working with anthropologists, sociologists and consulting representatives from various indigenous communities to explore the possibilities to include indigenous languages and knowledge. 

To further strengthen regional collaboration, the team is building a strategic alliance with Brazil. Such collaborations allow the project to expand its technical capabilities, but they also help challenge the assumption that AI development has to follow a predetermined path. 

This may ultimately be one of Latam-GPT’s most important contributions. The project moves away from simply adding more Latin American data to AI models and instead focuses on exploring what it actually means to develop a model within the region: “there are different ways in which we can make technology our own to serve the needs and the contexts of different people”. 

Dịch: Lê Trung Nghĩa

letrungnghia.foss@gmail.com

Tác giả: Nghĩa Lê Trung

Tổng số điểm của bài viết là: 0 trong 0 đánh giá

Click để đánh giá bài viết

  Ý kiến bạn đọc

Những tin cũ hơn

Về Blog này

Blog này được chuyển đổi từ http://blog.yahoo.com/letrungnghia trên Yahoo Blog sang sử dụng NukeViet sau khi Yahoo Blog đóng cửa tại Việt Nam ngày 17/01/2013.Kể từ ngày 07/02/2013, thông tin trên Blog được cập nhật tiếp tục trở lại với sự hỗ trợ kỹ thuật và đặt chỗ hosting của nhóm phát triển...

Bài đọc nhiều nhất trong năm
Thăm dò ý kiến
Bạn quan tâm gì nhất ở mã nguồn mở?
Thống kê truy cập
  • Đang truy cập368
  • Máy chủ tìm kiếm8
  • Khách viếng thăm360
  • Hôm nay58,637
  • Tháng hiện tại257,735
  • Tổng lượt truy cập61,004,821
Bạn đã không sử dụng Site, Bấm vào đây để duy trì trạng thái đăng nhập. Thời gian chờ: 60 giây