LongCat-2.0 공개 - Nvidia 없이 학습한 1.6조 파라미터 오픈소스 모델
LongCat-2.0 공개 - Nvidia 없이 학습한 1.6조 파라미터 오픈소스 모델 총 1.6조(1.6T) 파라미터와 토큰당 약 480억 개 활성화 규모의 대규모 MoE 언어 모델로, 오픈소싱과 함께 여러 아키텍
LongCat-2.0 공개 - Nvidia 없이 학습한 1.6조 파라미터 오픈소스 모델 총 1.6조(1.6T) 파라미터와 토큰당 약 480억 개 활성화 규모의 대규모 MoE 언어 모델로, 오픈소싱과 함께 여러 아키텍처 개선 동반 전체 학습과 대규모 배포를 전부 AI ASIC 슈퍼팟에서 수행, 35조 개 이상 토큰에 걸친 사전학습을 롤백·복구 불가능한 손실 급증 없이 완료 LongCat Sparse Attention(LSA) 도
정리
핵심 요약
LongCat-2.0 공개 - Nvidia 없이 학습한 1.6조 파라미터 오픈소스 모델 총 1.6조(1.6T) 파라미터와 토큰당 약 480억 개 활성화 규모의 대규모 MoE 언어 모델로, 오픈소싱과 함께 여러 아키텍처 개선 동반 전체 학습과 대규모 배포를 전부 AI ASIC 슈퍼팟에서 수행, 35조 개 이상 토큰에 걸친 사전학습을 롤백·복구 불가능한 손실 급증 없이 완료 LongCat Sparse Attention(LSA) 도
출처: GeekNews
이 아티클로 만든 나만의 공식 0개
아직 이 아티클로 만든 공식이 없어요. 첫 번째 공식을 남겨보세요!
나도 공식 만들기
댓글
0댓글을 남기려면 로그인이 필요해요.
아직 댓글이 없어요. 첫 댓글을 남겨보세요.