리더보드 1등 LLM, 토스에서도 1등일까?

Toss Benchmark 구축기

리더보드 1등 LLM, 토스에서도 1등일까?
토스증권이 GPU-aware를 넘어 GPU-native 클러스터를 구축한 방법
App Router의 장점은 우리에게도 장점일까요?
AI가 만든 코드가 어드민이 되기까지
인기 있는 글
최신 댓글
명랑한고릴라
명랑한고릴라
서술하는 이슈는 특정 domain 지식 부재 및 새 데이터가 없는 문제점 같습니다. RAG 과 db 연동 mcp, 검색 툴콜 하는 하네스 등이 탄생한 이유이지 않나 합니다. 물론 더 알맞은 모델을 선별하는 시작점으로 유용하게 봤습니만, 지속적인 정보 누적 및 활용이 목적이라면 그런 방법 및 테스트도 측정 좋지 않을까합니다
리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기
활기찬펭귄
활기찬펭귄
저도 다정한북극곰님과 읽으면서 같은 궁금증이 들었는데 parametric knowledge 에 평가하신 모델들은 모두 특정화장품회사가 뭐 팔고, 프리미어리그에 누가 우승했고 이런 knowledge 를 pre-traing에서 어떻게든 filtering 하려고해요. knowledge 자체를 parameter 에 있는지 평가하는거 자체가 조금 어색하게 느껴지긴합니다. 특히나 LLM 이라면 더욱이요. 이런것들은 Agentic 하게 Knowledge base 에 접근해서 훨씬 올바른 방법이라고 생각됩니다. 일단 회사 내부의 사정이 있겠지만 그렇다면 평가하려는 후보군(gemini, gemma 등) 자체 선정도 조금 어색한 느낌이드네요.
리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기
쾌활한물개
쾌활한물개
시계
토스의 이모지 폰트, 토스페이스 제작기
다정한북극곰
다정한북극곰
유저: 어휴 멍청한것들 찐빠봐 체크를 라디오로 쓰네... 뭐 죽는건 아니니까 넘어간다... ??: 오 이거좋은데?
[미디클] 라디오 vs 체크박스 뭐가 좋을까? EP.1
아티클 시리즈